岗位职责
- 参与音频/音视频多模态 Agentic 能力研究与实现,探索 Long-horizon 推理、全模态交互、Coding 等场景下的能力提升方法。
- 参与音视频理解基础能力研发,包括 Caption、Grounding、音视频对齐、General QA、长视频理解、多音视频理解等方向。
- 参与音频/语音理解基础能力研发,包括 ASR、Multi-speaker ASR、语音/音频 Grounding/Counting/QA、音乐理解、长音频理解、多音频理解等方向。
- 参与音频/音视频 Post-training、RL、OPD 等训练方法研究与实验验证。
- 参与音视频通话与交互能力优化,包括全音视频双工、音频 Query 理解与体验优化等。
- 参与语音生成基础能力研发,包括音色克隆、可控性、长语音生成稳定性等方向。
- 参与全模态模型自主优化、Self-evolving 与评测迭代。
职位要求
- 计算机、人工智能、电子信息、自动化、数学等相关专业在读,对音频/音视频多模态方向有浓厚兴趣。
- 具备音频/语音理解与生成、多模态对齐与交互(如音视频 Alignment、Captioning、Grounding),或 Agentic AI、长程推理、Omni 模型等任一方向的项目经验。
- 熟悉 PyTorch 等深度学习框架,具备良好的工程实现能力与实验分析能力,能够独立推进模型训练、调试或评测。
- 有相关论文、开源项目、技术竞赛或高质量项目经历者优先。
- 具备较强的学习能力、自驱力和沟通协作能力,能够快速理解问题并形成有效实验方案。