岗位职责
- 专注于解决大规模分布式模型推理中的通信瓶颈,优化通信效率;
- 深入分析NCCL/MPI等通信库在All-Reduce、All-Gather等集合操作中的性能问题,并利用GPUDirect RDMA、InfiniBand等高速网络技术进行底层优化;
- 设计与实现异步通信、计算-通信重叠、拓扑感知集合通信等策略,实现通信与计算的高效重叠,最大化GPU集群在TP/PP/EP等并行场景下的整体效率。
职位要求
- 精通C++/CUDA/Python编程,具备扎实的算法和数据结构基础;
- 深入理解分布式训练/推理的并行范式(Tensor Parallelism, Pipeline Parallelism, Data Parallelism等);
- 拥有丰富的通信库优化经验,熟练掌握NCCL/RCCL/MPIUCX中至少一种,并理解其内部机制;
- 精通GPU间通信原理,对PCle、NVLink、NVSwitch、InfiniBand网络架构有深刻理解;
- 具备出色的性能分析和调试能力,熟练使用Nsys, Nsight Systems, Nsight Compute, IPM等工具。