岗位职责
我们是蚂蚁集团网络技术团队,为蚂蚁全站提供“通智一体、稳定高效”的网络基础设施产品、平台与服务。网络监管控平台将直接服务蚂蚁阿福、阿宝、灵光等 AI 业务背后的万卡级智算网络。 - 负责 AIDC 网络平台核心能力建设,实现端网“监管控”能力闭环,为万卡级智算网络构建高可用的运维底座; - 建设覆盖“网络 + 算力”的可观测与大数据分析平台(Metrics / Log / Trace + 网络流遥测),依托实时 / 离线大数据分析与图计算,实现网络故障的快速发现、诊断、隔离与自愈,持续降低智算网络 MTTR; - 落地 AIOps 智能运维,推动告警智能降噪、拓扑自适应、根因定位与自动化处置等能力建设,并将大模型能力原生融入网络运维全链路。
职位要求
- 计算机相关专业本科及以上学历,3 年以上平台或系统软件研发经验,熟练掌握 Go / Python / C++ / Java 至少一种; - 熟悉数据中心网络与商用/白盒交换机的功能与业务,掌握 SNMP / Netconf / YANG、gNMI / gRPC、sFlow / INT 等管控与遥测协议,有大规模网络管控或监控平台研发经验; - 熟悉可观测与大数据相关技术 Grafana 、Flink / Spark、ODPS(MaxCompute)等,具备实时 / 离线大数据分析与图计算研发经验,有海量遥测与日志数据采集、存储、分析平台研发经验; - 熟悉 AIOps、智能根因分析(RCA)、故障自愈等相关技术,有时序异常检测、图算法等在运维场景的应用经验; - 具备前后端全栈及 AI 应用开发能力,能独立完成后端服务、前端可视化与平台功能交付; - 熟悉 Linux 与 CI/CD,对系统稳定性、可扩展性有深入思考,具备较强的调试排障与跨团队协作能力。 加分项: - 有AIDC / 智算中心监管控或运维平台研发经验,解决过 RoCE / RDMA、AI 网络拥塞丢包等实际问题; - 主导或深度参与过 AIOps / RCA / 故障自愈系统的规模化落地,并取得可量化收益(如 MTTR 显著下降、告警收敛率提升等); - 熟练使用 AI 辅助编程(Claude Code / CodeBuddy / Codex 等),具备较高的个人交付效率。