岗位职责
面向多模态基础模型能力建设,负责图像、视频、文本、音频等多模态模型的训练与优化,包括预训练、后训练、跨模态对齐和能力增强,持续提升模型在多模态理解与生成方面的表现。
- 原生多模训练 负责全模态原生训练方案推进,实现音频/视频/图片/文本 在语义层面的深度对齐,持续优化训练阶段 和 全模态数据质量
- 全模态强化学习与对齐 构建全模态强化学习框架,将RL输入从纯文本 拓展至 音频/视频/图片/文本 全模态序列,优化模型跨模态推演能力同时,实现全模态间的协同进化。 利用生成式奖励模型(Reward Model)与细粒度的人类偏好学习,在审美、情感、文化等感性维度 和 人类偏好 进行对齐。
- 视觉驱动的行动力优化 推动模型从“认知工具”演进为具备高阶行动力的智能体。负责以视觉为中心的前端代码合成 和 工具调用(Vision-centric coding/Tool Use),通过引入视觉反馈闭环提升模型纠错能力, 实现从像素级视觉输入到高保真前端代码的端到端转换。
- 图像/视频可控生成 负责研发多维度生成控制与编辑技术,支持内容增删改、风格迁移及属性调整,提升多轮交互编辑的精度与自然度,实现“AI版PS”式的可控图像生成及编辑。
- 数据和评测体系 参与多模态大模型数据体系与模型评测体系建设,覆盖数据采集、清洗、标注、增强及多维度能力评估,建设基于Agent驱动的数据合成链路,实现对模型效果的量化分析与持续迭代。
- 语音理解 参与语音识别方向的能力建设与持续优化,提升模型在多方言、多口音、多噪声场景下的准确率与鲁棒性,推动模型的识别能力从转录向细粒度、深度语义理解延伸。
- 语音/音乐生成 参与语音合成与音乐生成方向的能力建设与迭代优化,提升合成语音的自然度、表现力与可控性,推动音乐生成在旋律、编曲、风格迁移等维度的质量提升。
- 语音对话 参与端到端语音对话方向的能力建设,涵盖语音输入理解、对话生成与语音输出的效果提升,优化模型在实时性、上下文建模与多轮交互体验上的表现。
职位要求
基础要求
- 学历背景:计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制;
- 编程功底:熟练掌握 Python 编程语言,熟悉主流深度学习框架(如 PyTorch);熟悉常用的大数据处理框架(如 Spark、Hadoop 等);
- 理论基础:具备扎实的机器学习、深度学习理论基础,了解自然语言处理(NLP)或多模态大模型的基本架构与原理。 专业能力
- 熟悉图像、视频、文本等多模态数据处理流程和工具;
- 熟悉常见的多模态预训练、跨模态对齐、理解/生成模型,并有实际训练 或 应用经验;
- 熟悉 Transformer/Diffusion 等大模型结构原理、分布式调度系统、大模型训练/推理/Agent 系统、高性能软硬件架构等任一领域的专业知识;
- 能够熟练阅读多模态前沿论文,并有论文复现能力。 加分项
- 顶级竞赛:参加过国内外知名算法竞赛(如 Kaggle、ICPC、ACM等)或信息学、数学、物理等学科奥林匹克竞赛,并取得优异成绩;
- 学术视野:在顶级国际会议/期刊(如 NeurIPS、ICML、ICLR、ACL、CVPR 等)以主要作者身份发表过 AI 相关论文;
- 开源贡献:有算法工程化落地经验,在主流大模型开源社区或算法库(如 HuggingFace、Megatron 等)有代码开发、维护或 PR 贡献经历。