岗位职责
- 负责大模型后训练,评测体系建设;
- 运用 SFT、DPO、GRPO、RLHF 等后训练方法对大语言模型进行微调和对齐,提升模型在特定场景下的指令遵循、推理和生成质量;
- 模型评测:设计rubrics,Reward Function,建设可量化的模型评测体系;
- 参与高质量训练数据的构建:数据合成、清洗、去重、配比,搭建可持续迭代的数据 pipeline;
- 跟踪后训练前沿技术(如 Agentic RL、Long CoT、拒绝采样等),进行技术预研和落地验证。
职位要求
- 计算机、人工智能、数学等相关专业,本科及以上学历;
- 扎实的 Python 编程能力,熟练使用 PyTorch 深度学习框架;
- 熟悉大模型训练流程:SFT 微调、大模型强化学习(DPO/GRPO/RLVR)、分布式训练(DeepSpeed/Megatron);
- 熟悉主流大语言模型(Qwen、DeepSeek、Llama等)的使用和微调。