岗位职责
-Scale‑out 通信性能优化:负责大规模集群中跨节点(Scale‑out)通信效率的提升。深入分析 RDMA 协议栈(RoCEv2 / InfiniBand)在真实业务场景下的表现,通过调整拥塞控制参数、优化传输队列及中断/轮询模式,降低通信延迟并提高带宽利用率;针对 All‑Reduce、All‑to‑All 等集合通信算子进行性能画像,定位协议层瓶颈,输出可量化的优化方案 -RDMA 网卡效果验证与落地:将优化成果在RDMA 网卡上实际部署,搭建标准化测试环境,设计覆盖不同报文大小、多流并发、故障注入等场景的基准测试套件;完整评估网卡在优化前后的吞吐量、时延、CPU 利用率等关键指标,撰写测试报告,确保优化措施在硬件上稳定、有效,并推动最终产品化落地 -端侧可编程拥塞控制算法研究:基于RDMA 网卡的端侧可编程能力(如 P4、eBPF 或定制微引擎),探索新型拥塞控制算法;研究现有算法(如 DCQCN、Timely)的不足,结合网络流量特征和业务优先级,设计并实现自适应拥塞控制逻辑,在网卡本地快速响应拥塞信号,减少对 CPU 的依赖,提升整体网络的可靠性和公平性 -Scale‑up 超节点推理性能调优:在超节点(高带宽域内)环境中,聚焦节点内/间通信(Scale‑up)对主流大模型推理效率的影响;分析 TP(张量并行)、PP(流水线并行)、EP(专家并行)等并行策略下的通信依赖,结合 vLLM / SGLang 等推理框架,优化传输及调度逻辑;端到端验证模型部署后的吞吐量(Throughput)、首 Token 延迟(TTFT)和每 Token 处理时间(TPOT),提出并实施可落地的通信优化方案,确保推理性能达到业界领先水平
职位要求
-本科及以上学历,计算机、电子、通信或相关专业,对高性能网络或分布式系统有浓厚兴趣,具备扎实的计算机体系结构、操作系统和网络协议理论知识 -熟悉 RDMA(RoCEv2 / InfiniBand)的基本工作原理,了解其与传统 TCP/IP 的差异,有相关课程设计、毕业课题或实验项目经验(如使用 Verbs API 编程或模拟器验证)者优先 -了解 DCQCN、PFC、ECN 等主流拥塞控制机制,能清晰阐述其作用与不足,有网络仿真(如 ns‑3)或流量分析经历者加分 -熟练掌握 C/C++ 和 Python,具备 Linux 环境下的网络编程基础,对 DPDK 或用户态协议栈有初步了解或学习兴趣 -对 vLLM、SGLang 等大模型推理框架有基本认知,阅读过其源码或参与过小规模二次开发实践者优先;了解 Transformer 架构及分布式并行策略(DP/TP/PP/EP)的基本概念 -具备一定的实操经验,例如搭建过小型集群、运行过分布式训练/推理任务,或参与过开源项目贡献;能快速学习新知识,乐于从实验中定位问题并尝试解决 -自我驱动,主动性强,善于沟通协作,乐于分享技术见解。有技术博客、竞赛获奖或学术论文发表经历者优先考虑