岗位职责
- 负责音频相关大模型研发,包括音频理解(语音识别、语音翻译等)、语音对话模型等方向;
- 跟进前沿语音技术、行业动态及主流模型框架,开展相关学术研究并发表高水平论文;
- 研究强化学习在语音大模型场景中的应用,探索面向主观偏好的奖励建模、偏好对齐及策略优化技术;
- 研究端到端实时语音交互技术,解决语音理解、语音翻译及对话中的关键技术问题;
- 推动相关技术在B站视频理解、字幕、搜索及创作等场景中的落地。
职位要求
- 2027届应届毕业生,计算机科学、人工智能等相关专业本科及以上学历,具备扎实的机器学习、深度学习理论基础;
- 有语音大模型相关前沿技术研究及发表论文经验,理解语音/多模态模型的原理,熟悉大模型底层技术,敢于挑战技术边界;
- 对端到端语音交互技术有深刻理解,跨语言语音处理技术有实际研究和开发背景,熟悉相关模型和技术栈者优先;
- 有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先;
- InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先;
- 熟练使用AI agent能力者优先。