岗位职责
- 负责大模型训练框架与模型优化;
- 维护并优化面向较大规模的GPU/XPU的分布式训练系统;
- 研究并落地先进的模型后训练优化技术,包括但不限于知识蒸馏、强化学习等。
职位要求
- 计算机基础扎实,熟悉Linux操作系统、计算机网络、数据结构与算法、分布式系统等核心知识;
- 精通Python/C++;熟悉大模型深度学习框架(如DeepSpeed、Megatron-LM等),有较大规模的分布式训练实战经验;
- 熟悉模型优化核心技术,至少深入掌握蒸馏、强化学习(GRPO、PPO、DPO等)中的一种或多种方法,并有实际项目落地经验;
- 具备大型系统工程能力,熟悉软件研发全流程,能独立完成模块设计、开发与性能调优;
- 良好的沟通协作能力,积极主动,对技术有热情,乐于钻研前沿技术。 加分项
- 具有Agent模型落地经验;
- 具有端云混合架构设计经验;
- 在顶级会议(如NeurIPS、ICML、ICLR等)发表过相关论文;
- 在Github有相关开源项目,或是在相关知名项目中有代码贡献;
- 熟悉混合精度训练、训练时投机采样、FP8等分布式训练优化技术。