岗位职责
● 负责Lindorm、OceanBase等云上分布式数据库/存储系统的部署、监控、高可用设计以及故障应急,保障数据库稳定性 ● 提升存储集群性能调优、容灾方案设计(如多机房容灾、数据备份恢复等),提升系统的健壮性 ● 针对业务场景设计存储选型方案,平衡性能、成本与可维护性。 ● 制定存储产品,组件运维、变更SOP,以及容灾演练机制与应急预案 ● 推动开发团队落地数据库使用最佳实践、以及平台能力的持续演进,降低人为故障风险
职位要求
● 3年以上大规模分布式存储(HBase、MySQL、OceanBase)等运维经验,熟悉底层架构原理。 ● 精通Linux系统,熟练运用各种监控工具如Grafana、Prometheus等监控工具,具备全链路的问题定位能力 ● 对运维体系化建设有方法论,能够独立主导复杂问题攻关 ● 具备强抗压能力,对生产环境故障有敬畏心,追求极致稳定性 ● 计算机相关专业本科及以上学历