岗位职责
- 设计面向实时多模态理解、交互和生成能力的评测指标体系与 Benchmark;
- 构建音视频流式评测任务、数字人/虚拟环境交互任务、多模态生成任务等数据集;
- 研发自动化评测方法,结合规则评分、模型裁判、人评校准和统计分析提升评测效率与可信度;
- 分析多模态模型在理解、交互、生成、时序一致性、音画同步、行为自然性等方面的失败原因;
- 跟踪 GPT-realtime、Gemini Live、SeedRealtime、Sora、Seedance、数字人、虚拟角色、世界模型等方向的前沿进展,并转化为内部评测方法;
- 推动研究成果在真实业务中落地,产出评测基准、技术报告、专利、论文或开源项目。
职位要求
- 计算机科学、人工智能、机器学习、语音、多模态、计算机视觉、图形学等相关专业硕士及以上学历,博士或具备同等研究能力者优先;
- 熟练使用 Python,熟悉 PyTorch 或其他深度学习框架,能够独立完成算法实验、评测原型和数据分析;
- 熟悉以下一个或多个方向:Multimodal LLM / Omni-modal Model、Vision-Language Model、Speech LM / Audio LM、Streaming ASR / Streaming TTS、Audio-Visual Understanding、Digital Human / Virtual Avatar、Talking Head / Full-body Avatar、Motion Generation / 3D Facial Animation、Neural Rendering / 3D Gaussian Splatting、Video Diffusion / Diffusion Transformer;
- 具备较强的实验设计和问题抽象能力,能够把“自然不自然”“像不像真人”“交互顺不顺”这类主观体验转化为可验证的评测指标;
- 对多模态前沿技术有持续兴趣,能够快速阅读论文、复现方法,并结合业务场景形成可落地方案;
- 具备良好的工程能力和沟通能力,能够与算法、产品、工程团队协作推动评测体系落地。 加分项:
- 在 ICLR、NeurIPS、ICML、ACL、EMNLP、CVPR、ICCV、ECCV、SIGGRAPH、AAAI 等会议发表过高质量论文;
- 有多模态大模型、语音大模型、数字人、视频生成、3D 生成、虚拟环境或世界模型相关项目经验;
- 参与过 Benchmark、评测框架、数据集、开源项目或算法竞赛;
- 有 VLM-as-Judge、LLM-as-Judge、Audio Judge、人评一致性校准等评测经验;
- 熟悉 WebRTC、流媒体、实时推理、音视频处理、Unity、Unreal、WebGL、Three.js 等实时交互技术;
- 有数字人、虚拟陪伴、实时语音助手、AI 视频生成、交互式 AIGC 产品体验或研究经验。