岗位职责
负责大模型 SFT、偏好优化、RLHF/RLVR 等后训练算法研发与效果优化; 负责 Agent 能力建设,包括 Tool Use、多轮交互、任务执行与复杂指令遵循; 提升模型语言理解、生成质量、多轮对话和风格控制能力; 负责训练数据构建、评测分析和问题定位,推动模型能力持续迭代; 跟进后训练、Agent 等方向前沿技术,并完成实验验证和业务落地。
职位要求
熟悉各类后训练方法,包括 PPO/GRPO、OPD 等等; 有 Agent、Tool Calling、Harness 优化等相关项目经验; 熟练使用 AI Coding,同时具备较强的工程能力和个人品味; 能够独立负责一个模型能力方向,从问题分析、方案设计到实验落地。 加分项 有大模型后训练、Agent 相关实际落地经验; 有高质量论文、开源项目或大规模模型训练经验。