岗位职责
- 日常运维 • 负责数据中心日常运维及管理工作,制定数据中心基础设施运维策略与运维计划,保障设施稳定性,均衡考虑运维质量、效率、成本及安全 • 通过设施数字化运维管理,提高机房管控能力和兜底能力,保障维修及时率、风险闭环率等各项指标达标。
- 安全合规 • 落实数据中心内所有岗位的安全生产要求,推动数据中心在环保、消防、职业健康、法务、廉正等方面的合规运营,防止出现人员/设备的重大责任事故、行政处罚/责令整改等被动监管事件。 • 识别安全合规风险,建立并完善风险管理机制,负责重大事件的上报和跟踪处理。 • 建立属地资源网络管理,推动与属地政府关系的全方位深化,为属地稳定安全合规运营提供坚实保障。
- 优化改进 • 负责所辖数据中心的设施运维工作优化,制定/梳理阿里IDC运维管理制度、操作手册、应急管理流程和应急操作预案。 • 负责阿里IDC能效优化工作,实现机房高效运行。 • 负责协同经营成本团队,通过建立成本分析模型、人效模型,实现对成本效率的精细化分析管控,达成经营目标。
- 技术支撑 • 负责数据中心运维侧技术管理,能带领团队通过技术管理为数据中心设计、设备选型等技术迭代提供技术支撑。 • 承担业务设备的现场技术支持,了解业务需求和网络结构,通过团队合作有效支撑数据中心运营。
- 团队管理 • 负责数据中心运维团队的日常管理、考核、人才梯队建设、能力培养,规划数据中心运维人员技术培训工作,提升运维团队服务水平。 • 建立与运营商、上级主管等部门间顺畅的沟通渠道,防止出现数据中心运营风险,确保阿里运营策略要求合规落地。
职位要求
• 【设施运维】5年及以上数据中心基础设施运维或设计经验 • 1年及以上的数据中心运维管理经验 • 负责数据中心电气、暖通、自控、消防系统等主要系统的设施运维经验 • 【IT运维】3年及以上数据中心IT服务运维经验 • 1年及以上大型数据中心IT服务运维管理经验; • 负责大型数据中心IT服务运维运维的经验,熟悉信息技术基础设施领域,包括:服务器、网络技术、布线以及IT服务交付的原则和最佳实践 • 【资产管理】3年及以上数据中心IT资产管理经验,熟悉资产管理运作的流程和操作; • 具备较强的组织和协调能力,能够有效地执行资产管理日常计划工作和协调各个环节; • 【安全管理】3年及以上大型企业安全和职业健康管理相关经验 • 具备大型生产企业或数据中心安全及职业健康管理经验,支持过电气和暖通系统运营维护相关工作的安全管理者优先 • 精通基础设施特定专业领域的全生命周期管理(例如暖通、电气等) • 对业务问题有一定的判断逻辑,熟练运用流程、工具,识别风险并提前暴露问题,并能提出解决方案 • 负责落地IDC变更、故障等运行事件,跟进阿里IDC风险事件及应急故障处理 • 能够识别运维过程中的系统风险,并针对执行中的问题提出优化建议 • 能够制定所负责专业领域内的日常运营流程、规范、标准,推进相应标准的落地 • 能够通过数字化工具,建立复杂的工作流和日常运营模版,快速识别和解决运营问题,提升运维效率 • 能够根据业务要求,保证整体流程切实有效执行,完成所辖区域内多个IDC达成SLA要求的稳定性运营目标 • 具备一定项目管理能力,能够协调各业务相关方解决日常问题,能够主动分享、辅导团队新同学 • 能够与运营商的团队建立密切、高效合作关系,推动运营商建立面向用户的运营体系,提升代维人员能力与质量 • 子系统研发安全生产执行者 • 具备较强的研发安全生产意识,熟悉所负责子模块、子系统以及横向关联子模块、子系统的安全生产风险及预防措施,能够处置和恢复较复杂的安全和稳定性故障 • 在所负责的子模块、子系统的全链路研发流程中(需求理解、设计、测试、发布、运维)上严格遵循研发安全生产规范,保障系统的安全和稳定 • 具备参与研发安全演练的技术能力