岗位职责
- 负责字节跳动研发基础设施平台的Agent产品评测,方向涵盖研发效能、质量、可观测性等;
- 根据各方向垂域Agent的业务特点与价值,制定合理的评测标准与评测集;
- 开发对齐数据采集和生产的方法,确保数据质量保持在高标准,并根据定量和定性反馈不断改进,建立评测主导的效果演进;
- 评估数据生产工具对数据生产的有效性和质量的影响;利用LLM本身,不断提高人工和合成数据的效率和效果上限;
- 建设评测平台,为司内各垂域Agent/Skill提供具有普遍性、标杆性的评测体系。
职位要求
- 本科及以上学历,计算机科学、人工智能或相关专业优先;
- 1年以上的算法策略产品经理或算法工程师经验;对LLM/Agent效果评测及优化有深入的理解;
- 对Agent和人类行为有浓厚的兴趣;充满了好奇心,愿意花费时间阅读最新的论文和技术报告;
- 有较强的动手能力和新技术学习能力,能发现场景机会并动手实践;
- 了解DevOps、软件工程、可观测性、效能度量等相关领域知识者优先。