岗位职责
- 负责即梦创作Agent模型的后训练能力建设,提升模型在创作理解、任务规划、工具调用和多轮交互中的表现;
- 构建Agent SFT数据、多轮Function Call数据、工具轨迹数据和创作任务偏好数据;
- 探索Agentic RL、Rubrics-based RL、Unified Reward System等方法,提升Agent长链路任务成功率;
- 结合图片、视频、编辑、素材理解等多模态创作场景,提升模型对创作语言、视觉风格和用户意图的理解能力;
- 与Harness、评估、数据和产品团队协作,形成模型训练、自动化评估、线上反馈的持续迭代闭环。
职位要求
- 本科及以上学历,具备扎实的机器学习、深度学习和概率统计基础;
- 熟悉大模型后训练方法,包括但不限于SFT、RLHF、DPO、PPO、GRPO、RLAIF等;
- 熟练掌握PyTorch等主流深度学习框架,具备模型训练、数据处理和实验分析经验;
- 对Agentic RL、Tool Use、多轮Function Call、多模态模型训练有浓厚兴趣;
- 具备良好的实验设计能力和问题分析能力,能够从业务问题抽象出可训练、可评估的技术目标。