岗位职责
- 负责设计和优化大规模AI智算推理系统中GPU集群的高性能云网络架构,负责vpc网络中RDMA、GPUDirect、高性能网络协议栈等技术研发,提供GPU之间以及GPU访问KVcache的高吞吐、低延时网络。
- 负责AI agent场景中容器网络的设计研发,提供极致弹性的vpc网络,满足AI agent对容器的应用需求。
- 负责DPU、可编程硬件中vpc网络功能研发, 支持新型AI智算实例在阿里云的全面部署和运营。
- 探索下一代云网络分布式网关架构,打造超大规模的vpc网络。
职位要求
- 计算机专业、网络技术等相关专业尤佳,5年及以上网络相关经验;
- 精通计算机网络和网络编程,精通至少一门主流编程语言,比如C/C++, Python, Go等;
- 精通RDMA、TCP/IP、DPDK、OVS等网络高性能传输技术,了解集合通讯和P2P通讯的基本原理;
- 熟悉P4/DPU/IPU等相关软硬协同网络技术,熟悉当前网络和系统领域的新进展;
- 有数据中心网络、RDMA、用户态协议栈、高性能通信框架等开发经验者优先;
- 有强烈的技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力、沟通以及团队合作能力;喜欢挑战性的技术研发工作,善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破;
- 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。