岗位职责
- 负责情感化、长文本TTS研发,优化韵律自然度与跨句连贯性,提升语音表现力;
- 参与Voice Design技术开发,支持音色克隆、音色编辑等个性化能力;
- 探索双双工端到端S2S(语音到语音)对话技术;
- 基于CosyVoice、Seed-TTS、Whisper等开源框架进行调优与业务适配,根据需求参与ASR相关任务。
职位要求
- 计算机、信号处理等相关专业本科及以上学历;
- 有TTS或ASR任一方向的实战经验,熟悉至少一个主流语音模型(如CosyVoice、Seed-TTS、Whisper、Paraformer等);
- 具备以下任一经验优先:情感TTS:韵律控制、情感表达优化;长文本合成:段落级韵律规划与连贯性;Voice Design:音色克隆、音色属性编辑;端到端S2S:语音翻译、语音对话;多语言实践:葡语、印尼语等小语种语音处理;能阅读论文并动手复现,有ModelScope/Hugging Face使用经验加分;
- 我们提供:聚焦TTS核心体验:情感表达、长文本自然度、音色设计;探索S2S端到端方向,结合ASR/TTS构建完整语音链路;3K+小时高质量多语言语音数据 + 稳定GPU资源支持;技术方向务实,工程落地路径清晰,欢迎对语音有热情的同学加入。