岗位职责
- 参与大模型Agent能力的建设,包括但不限于:规划与执行(Planning/Execution)、工具调用(Tool-Use)、记忆(Memory)、反思与自我修复(Reflection);
- 建设面向Agent的评测能力,将Benchmark(如SWE-Bench、TAU-Bench等)工程化为可持续迭代的评估集与指标体系,并将评测结果闭环到框架与策略优化;
- 支撑RL训练闭环与工程优化,参与RL训练相关工程链路设计:采样、打分/Reward、回放、训练、验证与发布,推动训练与评测一体化;
- 深度参与Coding Agent、GUI Agent等核心能力实现与效果优化。
职位要求
- 对语言大模型、多模态大模型、智能代理Agent技术以及大模型的部署流程有基本的了解和认识;
- 具备熟练的Python/Go语言编程能力和良好的编程习惯和代码管理能力;
- 熟悉服务端基础技术,包括但不限于HDFS、Ray、消息队列等,能够高效地进行后端服务的开发与维护;
- 熟悉业务目前主流的Benchmark,如SWE-Bench、TAU-Bench等;
- 了解大模型RL训练基本概念与流程(采样、Reward、On-Policy/Off-Policy、稳定性与成本权衡),能够与算法团队高效协作推动落地。