岗位职责
本岗位聚焦通用音频大模型的前沿研究,围绕"听、说、唱、创"全能力统一建模展开攻关。实习生将深度参与语音理解与生成统一架构设计、全双工低延迟交互机制、多模态音视频协同生成等核心方向,探索混合Token架构、Test-Time Scaling、流匹配等前沿技术,推动音频大模型在智能语音助手、交互媒体等场景的落地。
职位要求
- 博士/硕士研究生,计算机等相关专业优先。
- 有扎实的理论基础,对大模型相关技术研究感兴趣。
- 在相关顶会或期刊发表论文、在高水平技术评测或竞赛中获得Top成绩、在开源组织有贡献或影响力者优先。