岗位职责
- 负责统一语音多模态大模型的设计、训练、优化,涵盖语音识别、语音合成、语音理解、文本-语音融合、跨模态检索与生成等方向;
- 推动语音与其他模态(文本、图像等)在统一建模框架下的深度融合,提升模型的理解、生成与交互能力;
- 跟踪并研究前沿的多模态学习方法,包括但不限于Transformer、对比学习、扩散模型、自监督学习、强化学习等;
- 参与大规模数据预处理、模型训练与推理优化,推动模型在实际场景中的高效部署;
- 与产品、工程团队紧密协作,将研究成果应用于智能助手、虚拟人、智能硬件、会议记录等业务场景。
职位要求
- 计算机科学、电子工程、人工智能、信号处理等相关专业硕士及以上学历,博士优先;
- 精通语音识别(ASR)、语音合成(TTS)、语音理解(SLU)等相关技术;
- 熟悉主流大模型及深度学习框架(PyTorch/Megatron/DeepSpeed),具备大规模模型训练与调优能力;
- 熟悉多模态表示学习、跨模态对齐与融合、自监督预训练方法;
- 具备良好的算法实现能力和工程落地经验,熟悉模型压缩、蒸馏、量化、加速等技术;
- 具有较强的研究能力和创新意识,曾在顶级会议(如NeurIPS、ICML、ICLR、ACL、INTERSPEECH、ICASSP等)发表过论文者优先;
- 良好的沟通能力和团队协作精神,能够承担高强度的研发任务。 【加分项】
- 有大规模语音-文本数据构建与清洗经验;
- 有端到端多模态对话系统开发经验或者实时通话经验;
- 了解语音前端处理(VAD、说话人分离、语音增强等);
- 熟悉语音大模型及其扩展应用;
- 有开源社区贡献经历或主导过知名开源项目者优先。