岗位职责
- 负责面向 AI Native 的云基础平台核心系统的架构设计、开发与运维工作,保障超大规模分布式系统的稳定性。
- 负责管控系统、运维自动化平台、监控告警系统的设计与持续优化,提供秒级响应能力。
- 参与容器化、存储服务、系统工具链、AI Agent 等基础设施的研发与技术演进。
- 负责 SRE 平台建设,包括生命周期管理、稳定性保障、可观测体系搭建等。
- 参与跨部门复杂项目的推进,协调业务和技术目标落地。
- 探索前沿技术在AI、数据库、云原生等场景的应用与落地。
职位要求
- 计算机科学、软件工程及相关专业,精通Golang/Java/Python至少一种语言以及相关技术生态,熟练掌握性能调优和高并发编程,具备良好的编码习惯。
- 非常好的业务需求理解能力,熟练使用 AI Agent 进行开发并交付有质量保障的工程项目。有较强的学习能力,技术眼界开阔。
- 熟悉常用的数据结构和算法、 Linux 操作系统、MySQL、Redis 等数据存储组件,具备系统开发能力和问题分析定位能力。
- 对技术保持热情,善于快速学习和动手实践,乐于分享、沟通和团队协作,勇于应对挑战。具备较强的风险意识,能准确识别风险并推动风险得到有效解决。 优先条件(至少满足一项)
- 熟悉至少一项云原生技术(如Docker/Containerd/KataContainer/gVisor/Kubernetes等),有相关开源项目贡献或者大规模开发运维经验者优先。
- 熟悉大规模异构资源集群(CPU/GPU/NPU/RDMA等)的调度、管理与性能优化,提升资源利用效率、系统稳定性与运行性能;有国产化芯片适配项目经验,具备端到端的性能优化能力。
- 熟悉 CI/CD 全流程设计,有代码管理、制品管理、自动化测试等工具链开发经验。
- 熟悉操作系统发行版构建和发布,了解包管理系统和系统安全加固。
- 有阿里云相关项目开发或运维经验,熟悉阿里云产品体系。
- 熟悉 Prometheus、Grafana 等监控体系,具备复杂问题定位能力。
- 熟练使用 AI 工具和平台,有提升开发效率、加速问题排查经验,有使用 Agent 进行性能调优项目经验优先。