岗位职责
【关于 Accio】 Accio 是一个追求极致的 AI Native Agent 产品/团队。我们不只是在做工具,而是在重塑人机交互的未来。在这里,我们为你提供充足的计算资源(H100/B200 集群支持)、深厚的研究氛围,以及由师兄(AI PhD & 顶会常客)亲自带队的指导。 【关于项目】 本项目旨在通过 RL 与其它后训练方法,优化 LLM/VLM 的 Agentic 能力,解决包括但不限于复杂指令遵循、Efficient tool use、Test-time Agnostic 等问题。
- 大规模后训练实践: 参与构建针对 Agent 能力的训练数据及环境,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优。
- 算法研究与优化: 探索 Agentic RL 的前沿算法,产出 Novelty 和实用性兼具的工作。
- 前沿追踪:Follow 最新的学术工作,例如复现 GAIA, BrowseComp, HLE 等最新测试集上的 SOTA 方案。
职位要求
- 2027年11月及之后毕业,硕士及以上学历,计算机、人工智能、信息科学、数学、软件工程等相关专业优先;
- 背景: 熟悉大模型训练流程;
- 技术栈: 熟悉 PyTorch,对 VeRL 、slime 等 RL 框架和分布式并行策略(TP/PP/DP/CP)有实操经验;
- 良好的论文阅读与工程实现能力,希望在顶会(NeurIPS, ICLR, CVPR)发表过高影响力工作。