岗位职责
- 负责语音大模型(Speech LLM)及语音生成技术的研发与迭代,聚焦高保真语音合成(TTS)、零样本音色克隆、情感/风格可控语音生成等方向,持续挑战技术边界。
- 紧密跟踪语音合成领域最新进展(如基于 LLM 的端到端语音生成、扩散/流匹配语音模型等),推动研究成果向业务转化,并在顶级会议/期刊发表高水平论文。
- 将语音生成技术工程化落地于 B站视频出海、内容创作、虚拟主播等核心场景,解决音色相似度、情感表现力、多语言支持等实际业务痛点,打造行业领先的语音创作工具。
职位要求
- 计算机科学、人工智能、信号处理等相关专业硕士及以上学历,具备扎实的机器学习、深度学习理论基础。
- 深入理解多模态与生成式模型原理,熟悉大模型底层技术(如 Transformer、Diffusion、Flow Matching、自回归建模等);在语音生成领域有前沿技术研究及论文发表经验,敢于挑战技术边界。
- 对主流语音合成架构有深入理解,熟悉 IndexTTS、CosyVoice等开源语音合成模型,具备模型训练、微调、推理优化及工程化部署的实战经验;
- 有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先。
- InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先。