岗位职责
】 您将作为核心骨干,深度参与以下一个或多个方向的研究与落地:
- 通信库算法设计与优化:针对大模型并行训练场景(Data/Tensor/Pipeline Parallelism),设计高效的集合通信原语(AllReduce, AllGather等)。 研究计算与通信重叠(Overlap)机制,开发自适应调度算法,最大化GPU/NPU利用率。
- MoE 专家并行通信方案设计与实现:针对 MoE 架构的 All-to-All 通信瓶颈,设计和实现高效的 Dispatch/Combine 通信方案,研究通信-计算重叠、低 SM 占用通信 Kernel、不规则流量聚合调度等优化技术。
- 分布式 KV Cache 传输系统建设:面向 PD 分离推理架构,基于 RDMA 构建跨节点 KV Cache 高速迁移系统,结合流水线化的 KV Block 传输,研究 KV Cache 量化压缩与分层缓存(HBM → DRAM → NVMe)策略。
- 超节点混合通信调度:针对超节点架构,建立 Scale-up 域内与 RDMA 域间通信的协同调度模型,研究并行策略(数据并行、张量并行、流水线并行、专家并行)的通信建模与自动搜索,为上层训练/推理框架提供拓扑感知的通信决策支持。
职位要求
基本要求
- 获得计算机科学与技术、计算机网络、通信工程、电子工程等相关专业博士学位。
- 在顶级会议或期刊(如SIGCOMM, NSDI, ISCA,SC, HPCA, ATC, IEEE/ACM ToN等)以第一作者身份发表过高水平论文者优先。 核心技能(满足其一即可,多项兼备者极佳)
- 分布式系统经验,对RDMA网络、熟悉NCCL、RCCL、MPI等通信库源码,有大规模分布式训练系统优化经验者优先;
- 有过大模型训练稳定性相关开发或者运维经验者优先,如大模型训练的故障定位,性能定位经验;
- 对大模型训练和推理框架熟悉,有分布式训练推理集合通信性能优化经验,或者kv cache通信优化经验、或者计算通信overlapping经验者优先;
- 算法与仿真能力:具备极强的数学建模能力,熟练使用NS-
- Omnet++或自研仿真器进行网络性能评估。 综合素质
- 对AI基础设施领域充满热情,具备敏锐的技术洞察力,能够独立思考并定义前沿问题;
- 具备优秀的代码能力(C/C++/Go/Python),不仅限于理论研究,更渴望将算法落地到实际产品中;
- 良好的沟通协作能力,能够跨团队(算法、芯片、系统、业务)推动复杂项目进展。