岗位职责
本项目旨在针对广域RDMA网络中的传输性能问题,紧密结合AI智算业务流量特征,设计并实现一套易部署的、高效的广域RDMA网络遥测、拥塞控制、传输丢包控制系统与高性能通信库,以提升跨域AI智算服务的性能与稳定性,并为未来广域分布式计算提供技术储备。具体目标如下:
- 建立面向AI智算业务的广域RDMA流量分析模型:深度融合阿里云真实训练/推理业务Trace与广域网遥测数据,刻画业务流量模式与丢包时空特征的关联关系,为机制设计提供数据驱动的依据。扩展实现面向 Scale-across的高精监控系统;
- 设计自适应于业务与网络的拥塞控制、丢包控制机制:针对AI智算业务流量特征与广域网丢包动态性,创新设计结合智能冗余重传与轻量级前向纠错的混合恢复策略和细粒度拥塞控制,实现快速丢包恢复与带宽有效利用率提升;
- 研发纯软件实现高性能长距RDMA传输框架:通过修改用户态RDMA通信库,重构关键接口与功能,将丢包控制机制无缝集成至RDMA软件栈,实现不依赖特定硬件的可部署方案,并验证其对AI智算业务与集合通信性能的提升效果;
- 面向 Scale-up/Scale-out/Scale-across 全场景的高性能通信库优化:针对阿里自研通信库,开展跨场景深度性能剖析,明确不同互联通信域下的性能瓶颈与优化空间。在 Scale-up 域聚焦节点内/近节点低时延通信优化,在 Scale-out 域强化集群间高吞吐传输能力,在 Scale-across 域完善跨域/跨机房通信的稳定性保障。同时探索PD分离场景下KvCache 存储结构与传输的协同优化。通过分层优化策略,实现全场景通信性能与稳定性的系统性提升。
职位要求
- 系统工程能力强;
- 有NCCL、DeepEP等通信库开发经验更佳;
- 有网络流量分析,网络测量相关经验;
- 了解AI 高性能文件存储、KVcache、分布式缓存等核心技术原理;
- 对网络架构、RDMA 协议有了解;
- 深入理解网络系统的工作原理;
- 对大模型训练/推理任务有深入的了解。