岗位职责
- 日常运维 • 负责数据中心基础设施日常运维及管理工作,制定数据中心基础设施运维策略与运维计划,保障设施稳定性,均衡考虑运维质量、效率、成本及安全。 • 通过基础设施数字化运维管理,提高机房管控能力和兜底能力,保障维修及时率、风险闭环率等各项指标达标。
- 安全合规 • 落实数据中心内所有岗位的安全生产要求,推动数据中心在环保、消防、职业健康、法务、廉正等方面的合规运营,防止出现人员/设备的重大责任事故、行政处罚/责令整改等被动监管事件。 • 识别安全合规风险,建立并完善风险管理机制,负责重大事件的上报和跟踪处理。 • 建立属地资源网络管理,推动与属地政府关系的全方位深化,为属地稳定安全合规运营提供坚实保障。
- 优化改进 • 负责所辖数据中心的基础设施运维工作优化,制定/梳理阿里IDC运维管理制度、操作手册、应急管理流程和应急操作预案。 • 负责阿里IDC能效优化工作,实现机房高效运行。
- 技术支撑 • 负责数据中心运维侧技术管理,能带领团队通过技术管理为数据中心设计、设备选型等技术迭代提供技术支撑。
- 团队管理 • 负责数据中心运维团队的日常管理、考核、人才梯队建设、能力培养,规划数据中心运维人员技术培训工作,提升运维团队服务水平。 • 建立与运营商、上级主管等部门间顺畅的沟通渠道,防止出现数据中心运营风险,确保阿里运营策略要求合规落地。
职位要求
【工作经验】 • 5年及以上数据中心基础设施运维或设计经验 • 3年及以上大型数据中心运维管理经验,有团队管理经验 • 领导自建园区、租用园区设施运维的经验 【体系建设能力】 • 能够制定园区日常运营流程、规范、标准,推进相应标准的落地 • 持续建立并推广标准化的运维体系和流程,降低运维风险,提升运营效率 • 能够根据业务要求,保证流程执行可控、人员管理到位、供应商配合,Region范围各IDC达成SLA要求的稳定性运营目标 【问题解决能力】 • 精通基础设施领域各主要专业领域的全生命周期管理(例如暖通、电气等) • 持续了解并学习行业内的新技术、新理论、新方法,并能适时应用到所属业务 • 专业领域的问题终结者,具备问题总结和平台建模能力 【风险治理能力】 • 具备业务、技术及运营的全局视角,对日常运维指标、问题、风险进行分析和研究,解决、优化和落地 • 能提前发现变更及运维侧的风险点,及时处理突发性故障,为所负责园区的基础设施稳定性负责 【团队管理能力】 • 负责园区团队的组织文化管理和运维生态团队的管理及考核,带领团队管理所管辖的IDC日常运维、生态员工和供应商的管理工作 • 能够驱动供应商在日常运维过程中提升配合意愿度来达成业务目标