岗位职责
- 构建端到端的 AI Coding 评测体系:设计覆盖多语言、多场景、多维度(正确性、安全性、可维护性、性能、一致性等)的自动化评测框架,支撑模型迭代与产品发布;
- 研发高质量评测数据集与指标:通过合成数据、真实用户反馈、开源项目挖掘等方式构建代表性评测集;定义并实现量化指标(如 Pass@k、CodeBLEU、执行成功率、静态分析合规率等);
- 开发智能评测 Agent 与仿真环境:构建可模拟开发者行为的评测智能体,支持复杂上下文(跨文件、工程级依赖、调试交互)下的能力评估;
- 协同算法与工程团队:参与大模型训练数据筛选与合成、RAG 效果验证、推理策略优化等环节,提供评测驱动的反馈闭环;
- 推动评测平台工程化:建设高可用、可扩展、低延迟的评测服务系统,支持大规模并发评测任务调度与结果分析。
职位要求
- 计算机科学、软件工程或相关专业硕士及以上学历;
- 精通 Python、Go 或 Java 至少一种语言,具备扎实的工程实现能力与良好的代码规范意识;
- 深入理解LLM技术栈,有Agent系统设计及开发经验优先;
- 熟悉大模型全链路(从模型训练到推理、各类AI框架),对AI研发助手有独到见解和创新思路,熟悉技术社区,参与过开源生态建设者优先;
- 有 AI Coding 相关评测体系设计、评测指标构建、训练数据合成与清洗等经验者优先;
- 熟悉云原生技术栈(Docker/Kubernetes),有高并发服务开发或评测平台建设经验者加分。