岗位职责
- 参与音视频多模态生成大模型的研发工作,包括音频基础能力(语音、音效、音乐)和Omni音频参考/编辑能力的研究;
- 研发基于扩散模型(Diffusion Models)、语言模型(Language Models)的音频生成算法和音视频生成算法;
- 参与音视频多模态理解大模型的研发工作;
- 持续关注国际前沿的AI技术动态并做技术创新,将最新技术成果融入业务模型,参与发表领域顶会论文和专利。
职位要求
- 人工智能、计算机、数学等相关专业硕士/博士学位;
- 有语音/音频相关方向研究背景,精通深度学习理论;
- 有较强的Python编程能力,熟练掌握 PyTorch/DeepSpeed/Megatron等框架;
- 发表过顶级会议文章(NeurIPS、ICML、ICLR、ACL、ICASSP、Interspeech等)、ACM竞赛获奖者优先;
- 有多模态、语音/音频大模型技术研发经验者优先;
- 对多模态AGI有强烈的热情和远见,在工作中有极强的自驱力和主动性。