岗位职责
- Code Agent模型Badcase分析与优化 深入分析Code Agent在真实研发场景中产生的Badcase,定位模型在代码生成、理解、调试等环节的缺陷根因; 针对典型Badcase构建可复现的评测样本,主导设计并落地针对性优化方案(如SFT数据构造、RL策略调整等),推动模型能力持续提升。
- Code Agent评测体系建设 主导构建和完善 Code Agent评测体系,涵盖代码正确性、研发流程遵从性、工具调用准确性、多轮对话一致性等维度; 设计自动化评测流程与归因分析框架,对模型表现进行多维度量化分析与根因归因,输出结构化的评测报告并驱动改进落地。
- 模型与Agent协同进化 探索模型能力与Agent架构的协同优化路径,研究工具调用、规划推理、记忆机制等Agent能力对模型进化的反哺作用; 主导模型迭代与Agent框架的联合优化实验,推动“数据->模型->评测->Agent→产品”的闭环进化。
职位要求
- 计算机、软件工程、人工智能等相关专业,硕士及以上学历;
- 具备2年以上大模型相关方向工作经验,有Code Agent或Agentic RL方向实践经验者优先;
- 熟悉Python,具备扎实的编程基础和工程实践能力,能够独立完成数据分析、评测脚本与自动化工具开发;
- 熟悉主流Code Agent框架(如Claude Code、CodeX、Qoder、TRAE、PI-Agent等)或有相关开源贡献;
- 对大语言模型有深入理解,熟悉SFT/RL等后训练技术路线;
- 具备较强的逻辑思维与问题拆解能力,善于从复杂现象中定位根因,并能独立推动问题闭环解决。 加分项
- 在AI顶会(ACL、EMNLP、NeurIPS、AAAI、ICLR、ICSE等)发表过论文;
- 有完整的AI Agent项目落地或评测经验。