岗位职责
全双工语音交互被视为语音对话系统的终极形态,也是人机交互体验实现质变的关键方向。然而,当前主流语音助手仍普遍采用半双工或伪双工架构,"用户说完→系统处理→系统回复"的串行流程使得交互体验与自然人机对话之间存在显著差距。同时,级联式的 ASR-LLM-TTS 架构还面临延迟累积、误差传递、表现力与实时性难以兼顾等一系列挑战。 本课题聚焦端到端架构下的全双工语音对话大模型研究,致力于打破"先听后说"的串行范式,探索理解与生成在统一隐空间中的联合建模路径,构建真正具备双向流式交互能力、高自然度与高表现力的下一代语音对话系统,并在车载、智能硬件、智能客服、情感陪伴等场景形成显著的体验优势。 具体研究方向包括:
- 双向流式端到端双工建模,探索单一模型同时处理输入音频流与输出生成的架构,攻克 turn-taking 决策、打断检测与流式解码的协同优化难题;
- 高表现力端到端对话模型,研究情感、风格、语速等细粒度控制与实时生成的平衡方案,打造多说话人、多风格、多语言的统一生成模型;
- 理解生成统一建模,探索从原始音频到原始音频的端到端映射,摒弃传统文本中间表示,捕捉并复现副语言信息,实现真正的"语音思维"。
职位要求
- 计算机/人工智能/认知科学等相关专业在读硕士/博士;
- 有扎实的理论基础,对大模型、多模态建模、强化学习等相关技术研究感兴趣;
- 加分项:在ACL/NeurIPS/CVPR等顶会发表过人机交互或多模态相关论文 或 有实际的多模态对话系统、智能体交互或具身智能项目开发经验。