岗位职责
研究方向
- 深度挖掘大规模互联网公开数据、海量业务场景真实语音数据(如客服通话、智能设备交互音频等),探索数据清洗、筛选、标注质量提升的低成本技术路径,目标构建类似 Wenetspeech、Gigaspeech 的高质量 ASR 训练数据集,解决传统数据构建成本高、规模有限的痛点
- 针对 ASR 场景下识别准确率、环境鲁棒性(如噪声、口音干扰)等核心指标,研究大规模预训练模型的轻量化、高效微调、推理加速方法,突破模型 “大而不优”“落地难” 的瓶颈,形成可直接应用于实际业务的技术方案
- 基于大语种(如中文、英文)已有的丰富训练数据与成熟预训练模型,探索迁移学习、跨语言知识蒸馏等技术,构建低成本、高效率的小语种 / 方言(如地方方言、小众语种)ASR 模型开发框架,快速扩展 ASR 系统的语言覆盖范围
- 与工程团队、产品团队紧密协作,推动研究成果的工程化落地与产品化应用,解决技术转化过程中的关键问题,保障项目顺利推进。
- 参与博士后团队的建设与管理,指导初级研究人员开展工作,分享技术经验与研究方法,营造良好的科研氛围。
职位要求
- 获得计算机科学与技术、电子信息工程、人工智能、机器学习、信号处理等相关专业博士学位不超过 3 年(含应届博士毕业生)。
- 具备扎实的深度学习、机器学习理论基础,熟练掌握 PyTorch、TensorFlow 等主流深度学习框架,能独立完成算法建模与代码实现。
- 熟悉语音识别(ASR)核心技术栈,包括但不限于声学模型(如 CNN、RNN、Transformer)、语言模型、特征提取(如 MFCC、Fbank)等;深入理解半监督学习、无监督学习、大规模预训练模型的原理与应用者优先。
- 有 ASR 领域项目落地经验(如实际场景下的模型优化、多语言识别系统开发、低资源数据训练等),或在顶会 / 顶刊(如 ICML、NeurIPS、ICLR、IEEE TASLP 等)发表过相关学术论文者优先。
- 有较好的学术成果者优先,如以第一作者身份在语音、人工智能领域的顶级会议(如 ICML、NeurIPS、ICLR、Interspeech、ICASSP 等)或顶级期刊(如 IEEE Transactions on Audio, Speech, and Language Processing 等)发表过论文,或拥有相关技术专利者。