岗位职责
- Speech & Omni 模型研发:进行支持语音、文本等多模态输入输出的端到端大模型训练与微调,优化模态间的对齐机制及交互延迟。
- 多模态数据处理:构建高质量的语音-文本-图像混合指令数据集,探索利用合成数据提升模型在复杂场景下的理解与生成能力。
- 前沿技术探索:跟进 Omni LLM 最新进展(如流式语音交互、情感控制、非语言声音理解),复现 SOTA 基线并协助验证新算法效果。
- 评测与 Bad Case 分析:建设完善多模态综合评测体系,深入分析跨模态幻觉、指令遵循偏差等问题,输出改进策略。
职位要求
- 人工智能、计算机、声学等相关专业在读硕士或优秀本科生。
- 熟悉 Python 及 PyTorch 框架,扎实掌握 Transformer 架构,对 LLM 原理有基本理解。
- 对 Omni LLM、多模态学习或语音技术(ASR/TTS)有浓厚兴趣,具备相关课程项目或自学经历者优先。
- 具备良好的英文文献阅读能力及代码复现能力,逻辑清晰,善于沟通协作。 加分项:
- 有 Speech LLM 后训练(GRPO, etc)或多模态模型实践经验。
- 熟悉分布式训练框架(DeepSpeed/Megatron)或高效推理优化技术。
- 在顶级会议(ICML, NeurIPS, ACL, ICASSP 等)有论文发表或高质量开源贡献。