岗位职责
- Agent 基础设施优化:在电商垂域开展大模型 Agentic AI 的关键要素构建与优化,涵盖环境工具建设(Environment/Tools)、高质量数据合成及 Reward Modeling;
- 后训练算法攻坚:优化 Post-training 算法(如 GRPO/PPO/SearchR1 等),提升模型在复杂环境下的工具使用(Tool-use)、规划(Plan)、深度推理(Deep Research)及报告生成能力;
- 全流程模型迭代:参与千亿级模型的 Agentic 能力全流程优化,包括 CPT (Continued Pre-training)、SFT、Post-train 及 Multi-agent RL,负责复现业界前沿工作并探索提出新算法。
职位要求
- 深入理解 LLM/RL/Agent 领域知识,熟悉常见的 Alignment 算法(如 DPO/PPO/GRPO/DAPO 等);
- 熟悉前沿 Agentic RL 算法与框架,参与过实际项目的开发与训练,具备敏锐的技术视野,对前沿研究保持敏感;
- 对 AI 技术充满热情,具备优秀的自驱力(Self-driven)和复杂问题解决能力;
- 拥有编程竞赛获奖经历、顶会论文发表记录或知名开源库贡献者优先。