岗位职责
随着人工智能技术的飞速发展,AI 大模型对计算资源的需求日益增长。数据中心作为支撑 AI 运算的基础设施,其网络性能和稳定性直接影响 AI 模型训练的效率和推理准确性。然而,当前的数据中心网络在处理大规模数据传输、高并发请求以及复杂网络拓扑时仍然面临诸多挑战。为此,开发新一代数据中心网络技术意在提升网络传输速度、降低延迟、增强网络的容错以及故障定位等能力,对于推动 AI 技术的进一步发展具有重要意义。本项目意在聚焦于阿里云面向 AI 大模型训练的网络性能和稳定性优化技术,具体解决如下几个关键问题:
- 关于 AI 训练网络中故障的快速响应和定位问题,如何通过建立集合通信 log、上层训练框架代码 log 以及底层网络拓扑信息进行横向关联后进行精准、高校的故障根因定位;
- AI 大模型训练要求网络能够针对故障快速恢复,恢复过程要保证新设备的热迁移,以及如何选择被迁移设备,保证客户侧无感知
- 关于下一代集合通信以及网卡侧的传输协议设计,针对性的对大模型训练和推理特征设计一套行之有效的优化技术,针对其周期性、突发式带宽的传输协议解决关键的技术挑战 交付指标:
- 发表 1-2 篇国际顶级会议论文(如 SIGCOMM/NSDI/OSDI/SOSP)
- 专利 1-2 发明专利
- 能够实际在阿里云生产环境运行的系统(非原型系统),产生实际的结果收益
职位要求
有良好的java、C++编程基础,对Linux系统以及RDMA网络有深刻理解,对编程能力和系统能力有强要求。