岗位职责
- 负责包括 SFT(监督微调)、Model Merge(模型合并)、OPD(在线/离线知识蒸馏)以及 RL(强化学习)在内的后训练算法研发与优化,探索更高效、更稳定的新型训练范式。
- 提升大模型在Reasoning、General Agent 以及Coding Agent等专项任务上的上限,构建具备深度思考和自主行动能力的基座模型。
- 模型架构探索与优化,探索更高效更有效的模型架构。
- 训练与推理效率的优化,如算子优化、显存优化等,实现高吞吐、低延迟的模型研发和落地。
职位要求
- 硕士及以上学历,计算机科学或相关专业背景。
- 具备大模型研发经验,在 Post-Training(如SFT、RL、OPD等)某一方向上有实操积累。
- 算法与工程兼备。熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等)。
- 具备极强的“发现问题-分析问题-解决问题”的闭环能力。
- 拥有良好的团队协作精神与跨团队沟通能力。 加分项:
- 相关领域的研究和实践经验,顶级会议发表过大模型相关论文,或作为核心贡献者参与过社区高 Star 开源项目。
- 具备大规模模型训练、调优及稳定性保障的实际研发和工程经验。
- 优秀的研究品味,卓越的动手能力,强大的自我驱动力等。