岗位职责
- 负责多任务、多语种 TTS 大模型的研发,包括预训练、后训练 与效果优化;
- 负责语音合成核心算法研发,包括 声学模型、声码器、Voice Cloning 等;
- 推动语音合成技术在实时对话、客服、社交、教育等业务场景中的落地与优化;
- 负责大规模语音数据处理与训练体系建设,包括数据清洗、评测、训练;
- 跟踪语音生成领域前沿技术,包括 Flow Matching、 DiTAR、DiT、多模态语音生成等方向。
职位要求
- 计算机、人工智能、通信等相关专业,3年+ TTS方向工作经验,硕士及以上学历;
- 熟悉 TTS 基础理论与主流模型,包括 FastSpeech、VITS、CosyVoice 等;
- 精通 Python,熟悉 Linux 与深度学习框架,如 PyTorch 或 TensorFlow;
- 具备语音大模型训练、多语种 TTS 或大规模语音数据处理经验优先;
- 熟练使用 AI Coding 工具或 Coding Agent 辅助研发,具备通过 AI 工具提升代码开发、实验迭代、问题排查和工程协作效率的能力。