岗位职责
- 参与前沿统一音频生成大模型的研发,涵盖数据体系设计、模型架构设计、训练优化等。
- 参与统一音频基座模型的训练,协助设计多目标强化学习(RL)对齐机制,实现语音、音效、音乐的联合优化与复杂场景适配。
- 在海量数据与大规模模型参数驱动下,系统性验证统一音频生成基座模型的Scaling Laws,探索统一音频生成模型的性能边界。
- 撰写高水平学术论文,推动研究成果发表在CCF-A类会议或领域顶会/顶刊。
职位要求
- 计算机、人工智能、电子工程、声学、信号处理等相关专业硕士或博士在读,毕业时间符合实习要求。
- 熟悉语音合成(TTS)、语音增强、音频生成等领域主流模型与前沿进展。
- 熟练掌握Python,精通PyTorch/TensorFlow等深度学习框架,具备良好的代码规范与工程实现能力。
- 对AIGC音频技术有强烈热情,具备优秀的逻辑思维、问题分析与团队协作能力,有较强的学习能力和问题解决能力,有自驱力,能主动追踪并复现前沿工作。
- 发表过相关领域顶级会议论文(NeurIPS、ICML、ICLR、ACL、Interspeech、ICASSP等)、参与行业有影响力项目或者ACM竞赛获奖者优先。