岗位职责
- 参与大语言模型 Agentic 能力的训练与迭代,覆盖 SFT、Agentic RL 等技术路线,包括训练数据构造、任务与奖励设计、训练调优及效果评估。
- 参与 Agent Harness 的设计、实现与优化,包括工具调用、上下文管理、多轮规划与执行调度等模块,持续提升 Agent 在真实任务中的成功率与稳定性。
- 持续跟踪 Agent 领域的前沿进展(学术论文、开源框架、业界产品),完成关键方法的复现与评测,并沉淀为可落地的内部技术方案。
- 优先考虑可以尽快入职的同学。
职位要求
- 理解 SFT、RLHF/RLVR 等训练范式的基本原理,具备大模型训练、评测或 Agent 开发的实践经验。
- 具备良好的问题拆解能力与自驱力,能独立完成"设计—实现—分析—迭代"的实验闭环。