岗位职责
- 负责语音交互与语音内容生产相关算法研发,包括语音合成、语音生成、语音克隆、音色设计、语音转换、语音识别与理解、语音大模型对齐与强化学习等方向。
- 面向实时互动与内容生产场景,研究语音/文本/视频/图像等多模态输入到语音的生成与控制,提升自然度、拟人度、情感表现力、音色一致性、风格可控性,以及流式低延迟、可打断的实时表现。
- 构建从数据采集清洗、模型训练评估、推理优化到线上服务与离线资产生产工具链的完整流程。
- 与音频、引擎、游戏产品团队协作,将算法能力应用到游戏 NPC 实时语音交互、角色语音、Agent 驱动的语音内容/资产生产管线和语音创新玩法中。
职位要求
- 计算机、人工智能、语音信号处理、电子信息或相关专业,应届硕士或博士。
- 扎实的机器学习/深度学习基础,熟悉生成式模型、Transformer、Diffusion、自回归建模、时序建模、多模态学习、RL 对齐等至少一个方向。
- 具备语音信号处理基础,理解声学特征(Mel 谱 / neural codec)、声学与语言学建模、语音前端处理(VAD / 降噪 / AEC)、流式推理,以及 MOS / WER / RTF 等评测指标。
- 优秀的编程能力和良好的工程习惯,熟练掌握 Python,熟悉 C++ 者优先;熟练使用 PyTorch 等至少一种主流深度学习框架。
- 具备良好的 AI 工程化能力,熟悉各类文本 / 多模态大模型的使用与集成,有 Agent / claw / harness 等工程实践经验者优先。
- 有以下至少一个方向的项目经验: 语音合成(TTS)及其情感 / 韵律 / 风格可控生成(CosyVoice 2 / F5-TTS /Fish-audio/ Voxcpm2,或豆包/MiniMax/11labs等商用语音大模型); 语音生成(音乐 / 音效 / 唱歌,如 Seed-Audio 等); 语音克隆、音色设计与语音转换; 语音识别与理解(ASR大模型、omni模型); 语音大模型对齐与强化学习(RLHF / GRPO等)。
- 理解语音生产与交互管线,了解数据标注、音频处理、模型训练、流式部署、线上监控等基础流程;熟悉相关开源生态与工程工具者优先。 加分项:
- 有实时语音交互落地、AIGC 语音内容生产或完整产品落地经验;
- 有 Agent / LLM 编排驱动的语音资产生产经验;
- 有语音顶会(ICASSP / Interspeech)或更高级别会议论文;
- 有高质量开源项目;
- 热爱游戏。