岗位职责
- 参与建设面向大模型与Agent的评测基础设施,将评估设计转化为稳定、可扩展、可观测、可复用的执行系统;
- 建设可复用的评测流水线与任务编排能力,持续完善Judge、Sandbox、风险检测等关键执行组件;
- 提升实验执行的稳定性、可观测性与结果追溯能力,参与将复杂任务流程和Agent交互过程抽象为可执行评估环境;
- 设计并实现大模型/Agent自动评测Pipeline,工程化落地Judge system、sandbox、风险检测等关键组件;
- 支撑多模型、多策略、多环境配置下的大规模实验执行,定位失败任务、排查模型调用链路、修复评分流程和提升实验可复现性;
- 与研究员协作将评估想法拆分为任务定义、输入输出协议、执行逻辑和监控指标,平衡研究需求和系统稳定性。
职位要求
- 计算机相关专业,具备扎实软件系统与工程实现基础;
- 熟练使用Python,有服务/平台开发、数据处理或Pipeline建设经验;
- 有大模型、Agent、评测平台、仿真环境或复杂后端系统开发经验;
- 重视代码质量、系统设计、稳定性、可维护性与线上可观测;
- 能将研究方案工程化落地,擅长跨团队协作推进复杂项目;
- 愿意长期建设评估基础设施,相关领域经验与开源成果优先。