岗位职责
- 负责火山引擎公有云多Region、AZ、IDC的全局站点架构设计,构建面向全站点的架构治理体系,确保从物理机房、网络、运维、公共服务等各对象的架构一致性;
- 主导站点服务分层体系建设,拉通并规范站点在设计态、部署态、运行态下的架构标准,通过架构表达、差异识别和闭环治理,提升云基础设施的稳定性和可管理性;
- 推动站点架构可视化能力建设,沉淀站点视图、服务依赖、网络拓扑、容量水位、稳定性风险、版本状态等核心架构资产,提升对云基础设施的全局掌控力;
- 以站点思维统筹稳定性、一致性、容量、成本、交付效率、安全合规等横向治理工作,通过数据驱动和平台化手段,系统性发现问题、定位根因、推动治理并验证结果;
- 协同研发、网络、机房、SRE、运维、安全等团队,推动大型横向架构治理项目落地,沉淀火山引擎站点架构方法论、治理规范和最佳实践。
职位要求
- 本科及以上学历,计算机、通信、软件工程等相关专业优先;5年以上互联网云计算或基础设施架构相关经验,具备专家级公有云站点架构、横向架构或基础设施架构经验;
- 深刻理解公有云Region、AZ、IDC、公共服务区、售卖区等站点概念,熟悉从物理设施、机房网络、IaaS基础能力、公共服务、PaaS到MaaS/AI层应用的整体架构;
- 熟悉公有云复杂网络架构,理解公网到内网、专线、VPC、网关、NAT、LB、DNS、控制面与数据面等关键链路的设计、高可用与稳定性风险;
- 具备优秀的系统化思维和架构抽象能力,能够抓住复杂问题本质,理解服务在设计态、部署态、运行态之间的差异,并通过平台化、数据化手段完成问题闭环;
- 主导或深度参与过横向稳定性、架构一致性、多站点治理或云基础设施治理项目,目标明确、过程清晰,并取得过可衡量的业务结果;
- 专业高效、重结果、强闭环,具备良好的技术写作和架构表达能力,能够清晰输出架构设计、治理方案、复盘报告和方法论沉淀,并保持持续学习。 具备以下条件者优先
- 有多Region、多AZ、多IDC场景下稳定性治理、架构一致性治理、容量治理、变更治理或容灾体系建设经验者优先;
- 有架构可视化平台、云基础设施管控平台、CMDB、SRE平台、自动化运维平台或容量平台建设经验者优先;
- 熟悉AI云、MaaS、高性能网络、RDMA、大规模GPU集群等基础设施架构者优先;
- 有公有云厂商核心基础设施、站点架构、区域架构、横向架构或云平台治理经验者优先。