岗位职责
- 探索更多可scalable的verfifier信号,并通过RL提升模型的各项能力。
- 提升reward model在创作、人类偏好、指令遵循等各专项上的能力,减少reward hacking和bias。
- 研究reasoning path压缩和外推,实现更高质量的推理思考。
- 将LLM的reasoning能力和Agent以及其他模态相结合,探索统一模态的reasoning。
职位要求
- 计算机、机器学习等相关专业,博士及硕士优先。
- 具有post-training或强化学习相关方向经验。
- 精通Python以及Pytorch等深度学习框架,具有较强的代码工程能力。
- 加分项: ①熟悉LLM推理引擎(如vLLM,SGLang)的实现。 ②曾发表顶级会议论文并具有一定的学术影响力,包括但不限于NeurIPS、ICLR、ICML、ACL等。 ③拥有知名开源项目,在开源社区具有较好的影响力。