岗位职责
- 研究并开发面向 Agent 能力的大模型后训练方法,包括 Agentic SFT、Preference Learning、Reasoning RL、Agentic RL 等;
- 构建和优化面向多步任务、工具调用、环境交互的训练数据与任务轨迹;
- 参与 Browser / Tool Use / Sandbox 等环境下的 rollout 训练闭环建设;
- 设计并实现 Agent 能力评测体系,评估模型在规划、执行、工具调用与任务完成上的效果;
- 与模型、数据、评测、Infra 和业务团队协作,将研究成果应用于国际站 / Accio 的真实业务场景;
- 推动技术成果在论文、开源项目或行业技术影响力上的沉淀与输出。"
职位要求
- 计算机科学、人工智能、机器学习、数据科学或相关领域硕士或博士在读 / 应届毕业生;
- 对大模型、Agent、强化学习、后训练(Post-training)等方向有浓厚兴趣;
- 熟练掌握 Python、PyTorch,具备良好的算法实现与工程能力;
- 具备较强的问题分析、论文阅读和研究探索能力;
- 具备良好的沟通协作能力,能够与研究、工程和业务团队共同推进项目落地。 加分项
- 在大模型训练、强化学习、Agent、Reasoning、Tool Use、Multimodal 等方向有研究或项目经验;
- 在 NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ECCV 等顶级会议发表论文,或参与过有影响力的开源项目;
- 有 LLM 后训练、RLHF / RLAIF / PPO / DPO / GRPO、Agent benchmark、Tool Use / Browser Use 等相关经验;
- 对跨境贸易、电商、搜索、商家经营等真实业务场景感兴趣者优先。 "