岗位职责
- 聚焦语音生成大模型技术研究,涵盖多模态融合,提升长序列建模能力与实时时性;
- 研发风格与情感可控技术,构建语义-时序-声学等多级可控接口,支持音色迁移与交互式编辑;
- 提升instruct tts的泛华,完成context-awaretts在小米业务场景上的落地。
职位要求
- 精通传统端到端和最新大语言模型TTS框架、熟悉声学模型与声码器,具备TTS大模型或语音克隆项目经验
- 对各个模块的原理、问题、改进点能有自己的深入理解;
- 具备较强的工程实现能力,有开源项目开发经验优先,沟通能力强;
- 在顶级学术会议或期刊发表过相关方向论文者优先;
- 硕士及以上学历。