岗位职责
- 负责服务器工具研发团队管理,主导团队项目规划,技术选型和架构设计,保障所有自动化工具项目按时高质量交付; - 服务器与IDC的自动化管理平台架构设计,含IDC管理、服务器上下线全流程、硬件故障闭环维修管理、全生命周期配件溯源管理、运维工单流转等模块,实现数万台服务器自动化运维; - 服务器成本管理体系搭建,牵头打通算力资源、机柜资源、电力容量、网络资源、固产管理、预算管理等多维度数据,落地算力成本精细化核算工具,实现算力成本自动分摊,助力业务优化投入产出比; - 跨部门协同,对接硬件测试与采购、IDC运维、业务需求、网络资源等部门,梳理不同场景下的IDC及服务器运维痛点,输出定制化或自动化解决方案,推动全公司服务器运维效率的整体提升;
职位要求
-本科及以上学历,计算机相关专业,5年以上DevOps/运维开发经验,3年以上团队管理经验,有大规模服务器及IDC的自动化运维经验。 - 具备全栈平台开发能力,熟悉Python/Shell/Golang等开发语言,熟悉Vue.js等前端框架,具备从后端接口、中间件调度到前端可视化页面的全流程开发能力; - 熟练使用Ansible/Saltstack/Airflow等主流配置管理与任务调度工具,有大规模自动化脚本开发经验,能够基于开源工具快速二次开发; - 拥有扎实的Linux系统技能,掌握TCP/IP、VLAN等网络技术,能够独立排查服务器集群中复杂的系统、网络或其他系统的联动故障; - 熟悉主流品牌的X86/ARM服务器硬件,对其体系结构有深度认知,熟悉CPU、内存、硬盘、PCIe设备等核心硬件的性能指标与故障特征; - 具备服务器硬件监控、自动化装机、维护、维修、配件管理等相关平台的从0到1搭建或深度优化经验,熟悉主流硬件和性能监控体系的落地实践; - 掌握IPMI、Redfish等服务器管理协议,有基于BMC接口开发远程管理工具的实际经验,熟悉主流厂商iDRAC、iBMC等带外管理系统; 加分项: - 熟练使用各类AICoding工具进行开发提效,能够进行高效的Vibe Coding; - 有大型IDC基础环境与IDC机柜资源、大规模服务器成本等管理系统研发经验; - 具备良好的技术视野,跟踪服务器自动化运维的前沿技术,持续优化现有工具体系;