岗位职责
- 研发下一代 Agentic System:通过多步规划(Planning)、反思(Reflection)与工具调用(Tool-Use)能力,为全球商家构建自动化"数字员工",实现复杂任务闭环(如自动化选品、智能营销策划),端到端交付高价值业务结果,定义 AI 原生的 B2B 贸易新范式;
- 面向阿里国际站海量异构 API 生态,构建基于强化学习的训练决策迭代技术:设计并实现复杂任务流下的环境模拟器(Environment Design)与多维度奖励函数(Reward Shaping),通过 RL 训练提升模型在动态、高并发 API 环境下的编排、纠错与执行能力。
职位要求
- 系统掌握强化学习理论,熟悉 PPO / DPO / RLHF 等主流算法的原理与工程实践;
- 具备大模型 Agent、Tool-Use、Planning / Reflection 等方向的研究或落地经验;
- 有环境模拟器(Environment Design)或奖励函数(Reward Shaping)设计经验者优先。