部门介绍
【 】 Accio是阿里巴巴国际数字商业集团阿里国际站内部孵化的一款战略级AI原生应用产品,Accio Work是阿里在海外落地的首个企业级AI Agent,通过持续探索Agent、Agent Harness、Post-training、RL、Memory等前沿技术,自研Agent模型、Agent系统,实现B2B AI Agent跨越式发展。我们拥有充足的计算资源(H100/B200 集群)、真实的大规模商业场景(覆盖海量活跃供应商与全球买家)、开放包容的研究氛围、高人才密度的团队指导。在这里,研究成果不仅能产出学术论文,还能直接作用于海量的真实B2B贸易场景。 【研究课题】 Agent模型后训练、Agentic RL、Agent Harness、Massive and Test-time Agnostic Agentic Post-training等等,推动Agent技术发展与落地效果的课题均可探索立项; 【
岗位职责
】(其一或多个均可)
- Agentic RL 研究与训练: 设计面向异步长程场景的 RL 方案,包括合成数据构造、奖励建模与模型训练,利用分布式框架(VeRL 等)进行大规模调优,产出 Novelty 和实用性兼具的工作;
- Agent核心能力建设与优化:包括但不限于自主规划(Planning)、多步推理(Reasoning)、工具/skill调用(Tool Use)、长短期记忆(Memory)及 RAG 增强。研究长程任务分解、执行监控、自主纠偏、主动通知等 Agent 关键能力,推动成果在 Accio 业务场景落地;
- Agent评测体系构建:搭建面向长程异步任务的评测基准,覆盖任务时间跨度、多轮交互、并发协调等现有 benchmark 未充分涵盖的维度;构建端到端的Agent评测体系,构建生产力场景benchmark,推动Agent在business场景落地;
- Agent大规模后训练: 参与构建针对 Agent 能力的训练数据及环境,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优;
- 复杂任务动态编排:设计并实现高扩展性的Multi-Agent协作框架(如Agent Swarm/Agent Team),支持将模糊的宏观目标递归拆解为原子任务;
- Long-horizon运行设计:构建结合""工作记忆+全局知识库""的多级存储系统,解决Agent长期运行中的信息遗忘问题,建立跨Agent的共享上下文能力,设计Agent持续进化框架;
- 前沿追踪:Follow 最新的学术工作,例如复现 GAIA, BrowseComp, HLE 等最新测试集上的 SOTA 方案。
职位要求
- 2027年3月及之后毕业,硕士及以上学历,计算机、人工智能、信息科学、数学、软件工程等相关专业优先;
- 熟练使用 Python / PyTorch,熟悉主流 RL 训练框架(VeRL、Slime等)及 Agent 开发框架,对分布式并行策略(TP/PP/DP/CP)有实操经验;
- 熟悉 Agent 系统设计,对 Tool-use、multi-step reasoning、skills 等能力具有深入理解;
- 在ICML、ACL、EMNLP、CVPR、ECCV、ICCV、NeurIPS、ICLR等顶级会议/期刊上发表论文者优先;
- 有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代。 【加分项】
- 具有知名大模型Post-training/RL实际训练经验者优先;
- 具有长程规划、异步任务调度、multi-agent 系统方向研究论文发表者优先;有高质量github开源项目者优先
- 具有知名Agentic RL 项目经验者优先;具备跨境电商或 B2B 贸易场景经验者优先;
- 具有较好的工程能力,有GUI/Coding/Search Agent构建、Agent记忆系统构建、Multi-agent协作设计者优先。