岗位职责
- 负责实时音视频交互与生成大模型的算法研发和技术路线设计,建设具备实时语音理解、视觉感知、视频生成、多轮对话、上下文记忆、世界状态保持与自然响应能力的多模态智能交互系统,探索理解、生成与交互统一的 Omni 模型架构;
- 参与 Speech LLM / Audio-Visual LLM / Realtime Multimodal LLM / Video Generation 等方向的研究与开发,包括但不限于语音语义理解、视频场景理解、端到端语音对话、多模态对齐、音视频联合建模、音视频同步生成、长视频生成及理解生成统一建模等前沿方向;
- 面向实时多模态交互场景,重点优化模型在流式输入与生成、低延迟响应、全双工交互、打断处理、轮次管理、音视频同步、人物/身份一致性、长时间时序一致性与世界状态保持等方面的能力,同时提升模型在噪声、多说话人及复杂真实环境下的鲁棒性,打造自然、连续、沉浸式的实时音视频交互体验;
- 参与音视频理解与生成大模型的数据体系建设,包括实时对话数据、医疗问诊音视频数据、Speech-to-Text / Audio-to-Text / Video-to-Text / Speech-to-Speech / Video-to-Video / Image-to-Video 等多模态数据构建,以及数据标注规范设计、数据合成、清洗、质量评估和高质量训练数据闭环建设;
- 负责模型训练、后训练、评测和推理优化工作,探索 SFT、偏好学习、强化学习、Reward Modeling、多模态指令微调、流式推理加速、模型压缩与部署等技术。
职位要求
- 计算机科学、人工智能、电子信息、语音技术、多媒体技术、生物医学工程等相关专业硕士及以上学历,博士优先;
- 对实现自然实时的人机音视频交互、推动 AI 解决医疗健康问题抱有热情,具备较强的算法研究能力、工程实践能力和技术判断力;
- 在以下一个或多个方向有深入研究或实践经验:语音识别 ASR、语音合成 TTS、语音理解 Audio LLM、Speech LLM、多模态大模型、视频理解、实时对话系统、端到端语音交互模型;
- 熟悉大模型预训练、SFT、RLHF/RLAIF、Agentic RL、Reward Modeling、模型评测、多模态对齐等技术者优先;
- 有医疗 AI、智能问诊、语音助手、视频理解、多模态临床数据或大模型产品落地经验者优先;
- 有 ICASSP、INTERSPEECH、ACL、EMNLP、NeurIPS、ICLR、CVPR、ICCV、AAAI 等顶会论文,或重要开源项目、大模型训练平台、语音/多模态系统建设经验者优先。