岗位职责
- 基于大语言模型(LLM)及多模态/全模态大模型,研究和开发前沿语音合成与生成算法(如 TTS、语音转换、声音/音乐生成等);
- 开发和优化面向线上应用的语音及音频合成系统,提升效果、效率和可扩展性;
- 探索并推进全双工/流式多模态大模型在语音理解、语音生成及实时语音交互方面的能力;
- 与研究和工程团队跨职能协作,推动项目从原型验证到生产落地。
职位要求
- 计算机科学、电子工程、信号处理或相关领域博士学位;
- 具备扎实的语音/音频处理基础,熟悉现代生成模型(如扩散模型、流匹配、自回归模型、基于编解码器的方法等);
- 具有将大语言模型扩展至语音/音频模态的实际经验(如语音分词器、多模态适配器、语音-文本联合训练等);有全双工或流式语音对话系统及实时交互建模经验者优先;
- 熟练使用 Python 及深度学习框架(如 PyTorch);有分布式训练经验者优先;
- 在顶级学术会议发表过论文(如 ICML、NeurIPS、ICLR、ACL、ICASSP、Interspeech 等)。