岗位职责
实时全双工语音大模型与多模态数字人系统的核心研发,攻克流式交互中的智能打断、接话时机、长程状态保持及音画同步等关键技术难题。
职位要求
- 实时语音/音视频交互方向 ○ 做过语音大模型、实时语音助手、语音通话 Agent。 ○ 理解用户打断、抢话、等待、接话时机、长对话状态保持。 ○ 有流式 ASR/TTS、Speech LM、Audio LM、多模态大模型经验更好。 ○ 能把“实时交互自然不自然”拆成评测指标和 benchmark。
- 实时多模态生成方向 ○ 做过数字人、虚拟人、语音驱动 avatar、talking head、全身动作生成、虚拟环境交互。 ○ 理解口型同步、表情动作同步、身份一致性、动作自然度、长时稳定性。 ○ 有 3D/动画/图形学/视频生成/多模态生成项目经验更好。