岗位职责
- 负责100+B参数模型,1M序列长度的大规模分布式训练(DDP、F SDP、TP、SP、PP)和推理支持(RPC框架、vLLM、TRT);
- 与算法部门深度合作,进行算法与系统的联合优化;
- 负责机器学习效率优化,包括但不限于:量化、剪枝、压缩、蒸馏、特征选择、NAS、编译优化;
- 负责特殊机器学习范式的支持,例如强化学习、联邦学习、图学习、优化器等。
职位要求
- 获得本科及以上学历,计算机、软件工程等相关专业优先;
- 熟练掌握Linux环境下的C/C++与Python语言,有良好的编程习惯及Coding能力;
- 接触过至少一种机器学习框架(TensorFlow/PyTorch/Jax或其他自研框架)优先;
- 有以下至少一项的背景知识与经验的优先:GPU编程,编译器,大模型训练推理框架;
- 具有独立解决问题的能力,良好的团队合作精神;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。