岗位职责
- 负责基础模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限;
- 探索更多可 Scalable 的 Verifier 信号,通过强化学习(RL)提升模型的各项能力;研究 Reasoning Path 压缩和外推,实现更高质量的推理思考,并将 LLM 的推理能力与 Agent 及其他模态相结合,探索统一模态的 Reasoning;
- 提升 Reward Model 在创作、人类偏好、指令遵循等各专项上的能力,减少 Reward Hacking 和 Bias,并研究面向 Agent 任务的用户体验建模与 Reward 优化,探索 User Model Rewarding 与 Behavioral Signal Mining,弥合 Benchmark 指标与用户实际体验之间的鸿沟。
职位要求
- 本科及以上学历,人工智能、机器学习、深度学习、软件工程、相关专业优先;
- 在深度学习、大规模模型训练、优化算法、生成式模型、自监督学习等领域有扎实的理论基础和实践经验,并至少在其中一个方向有学术成果或项目经历;
- 具有较强的代码工程能力,精通 Python 以及 Pytorch 等深度学习框架,熟悉LLM推理引擎(如vLLM,SGLang)的实现;
- 对基础模型的前沿问题有持续热情,具备独立思考能力和系统性研究思维,敢于挑战现有范式;能够独立应用技术解决复杂问题,主导或深度参与过有影响力项目的人选优先;
- 具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响力。