岗位职责
- 协助团队开展大模型核心应用的评测算法研发工作,参与benchmark构建和评测框架搭建工作;
- 参与构建和扩充高质量的评测数据集,协助打通线上/线下benchmark沉淀链路;
- 辅助研发和调优基于 LLM-as-a-Judge 的自动化评测体系,提升评测指标的置信度与对齐率;
- 参与自动化评测及竞品横评中的 Badcase 归因,为算法模型迭代提供数据支撑与优化建议;
- 跟踪大模型评测领域(LLM Evaluation、RAG Evaluation)的前沿技术与开源框架,协助整理技术资料并探索创新评测方案。
职位要求
- 计算机、人工智能、数据科学、自动化等相关专业,本科及以上学历;
- 对大语言模型(LLM)及 AI 应用有浓厚兴趣,有相关课程学习、科研项目或竞赛经验(涉及 NLP、大模型微调、RAG 检索增强生成等方向均可);
- 了解大模型评测基础理论,接触过 DeepEval、Ragas、TruLens 等任一评测框架,或有大模型数据标注、评测集构建经验者优先;
- 编程基础扎实,熟练使用 Python,熟悉 Pandas 等常用数据处理库,具备良好的代码习惯与自动化脚本编写能力;
- 具备良好的科研学习能力,能够主动跟进领域前沿技术,有相关论文撰写、竞赛获奖经历者优先; 实习时长不少于 3 个月,每周可到岗 4 天及以上,能尽快到岗者优先;工作态度认真负责,具备良好的团队协作能力与问题解决能力。