岗位职责
随着大模型技术迅猛发展,模型迭代速度远超传统评测体系更新。当前行业面临核心痛点:复杂任务与长尾场景缺乏有效评估标准,主观指标难以量化,人工评测成本高、效率低。现有系统难以支撑大规模模型集成与快速实验,制约了模型在真实业务中的落地。本项目旨在构建下一代评测体系,解决评估滞后与对齐难题,确保模型能力可测、可控、可用,为业务场景提供坚实技术底座,推动 AI 从“可用”向“好用”跨越,满足产业界对高质量模型的迫切需求。
- 深度挖掘大模型在复杂任务、长尾场景中的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集;
- 参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、创造性等主观评价上的表现;
- 设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性;
- 参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率;
- 跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地。
职位要求
- 本科及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先;
- 理论基础: 深入理解 Transformer 架构及大语言模型基础知识,熟悉模型评测方案(Evaluation)或具有后训练(Post-training,如 SFT、RLHF、DPO 等)经验;
- 具备卓越的代码工程能力,精通 Python 编程及 PyTorch 深度学习框架;有模型训练、推理加速或自动化数据合成经验者优先;
- 具备系统性研究思维,在国际顶级计算机会议/期刊(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)发表过一作论文,或在知名开源社区、顶级竞赛(如 ACM/ICPC、Kaggle)中有突出成果。