岗位职责
- 负责视频生成大模型/多模态大模型在最新硬件平台上的训练/推理性能分析与优化,目标达成该硬件平台上的极限性能;
- 负责分析并提升大规模分布式训练系统的集群性能,完成对大规模训练任务故障的根因定位与稳定性提升。
职位要求
- 掌握Python/C++编程语言,熟练使用Pytorch训练框架或SGlang/vLLM等大模型推理框架;
- 掌握大模型领域基础算法知识,熟悉常规Transformer/SD模型结构,以及对应的常用性能优化方法;
- 深刻理解GPU硬件体系结构,能熟练编写高性能cuda kernel; 加分项
- 有分布式大模型训练框架(Megatron/FSDP)或分布式推理引擎开发经验者优先;
- 有在超节点硬件环境上,做过训练/推理性能优化者优先;
- 有GPU高性能算子库(Cutlass/Cute、PTX、汇编)、集合通信库(xCCL)、AI编译器(XLA/Dynamo)开发经验者优先。