岗位职责
- 参与建设面向大模型与Agent的评测基础设施,将评估设计转化为稳定、可扩展、可观测、可复用的执行系统;
- 负责已定义评估方法的稳定运行及结果接入研发流程,重点建设可复用的评测流水线与任务编排能力,持续完善Judge、Sandbox、风险检测等关键执行组件,提升实验执行的稳定性、可观测性与结果追溯能力;
- 参与将复杂任务流程和Agent交互过程抽象为可执行评估环境,设计并实现大模型/Agent自动评测流水线,工程化落地Judge system、Sandbox、风险检测等关键组件,支撑多模型、多策略、多环境配置下的大规模实验执行;
- 日常工作中定位失败任务、排查模型调用链路、修复评分流程和提升实验可复现性,与研究员协作将评估想法拆分为任务定义、输入输出协议、执行逻辑和监控指标,在研究需求和系统稳定性间寻找平衡。
职位要求
- 计算机相关专业,具备扎实软件系统与工程实现基础;
- 熟练使用Python,有服务/平台开发、数据处理或Pipeline建设经验;
- 有大模型、Agent、评测平台、仿真环境或复杂后端系统开发经验;
- 重视代码质量、系统设计、稳定性、可维护性与线上可观测;
- 能将研究方案工程化落地,擅长跨团队协作推进复杂项目;
- 愿意长期建设评估基础设施,相关领域经验与开源成果优先。