岗位职责
- 主导搜索/推荐核心链路的端到端稳定性建设,基于 SLO/SLI 与错误预算管理变更节奏,确保高可用与快速交付;
- 设计并演进全链路监控、告警、自愈、降级体系,构建自动化响应与回溯机制,加速问题定位与恢复;
- 深度优化计算、存储、调度、编译链路性能,引入并落地 JIT/AOT 等前沿技术,支撑高吞吐、低延迟算法场景;
- 运营与优化 Zookeeper、Nginx、消息队列等核心组件,保障超大规模分布式环境的稳定性与性能;
- 推进非标服务标准化、容器化与云原生化,利用 Kubernetes 构建规模化、自动化、可灰度的交付与运维体系。
职位要求
- 计算机相关本科及以上,5+ 年 Dev/Ops 经验;具备重大生产事故应急处置记录者优先;
- 精通 Java/C++/Go 任一语言,能进行系统复杂度与架构设计权衡;熟悉 JVM 底层与编译优化,具备算法、缓存、并发设计经验优先;
- 深入掌握 Kafka/MQ 等消息中间件与 ETL 数据处理;精通 MySQL/PostgreSQL、Redis、HBase 等数据库及一致性原理;
- 熟悉 Zookeeper 集群部署与调优,熟悉 Nginx 高性能配置与流量治理,具备分布式协调与大规模流量管理经验;
- 熟悉 Kubernetes、Operator、容器运行时,理解容器网络与 Serverless 架构;
- 具备千节点级容量规划、混沌工程、多活容灾经验;熟悉网络协议、存储与内核调优;可进行端到端性能剖析(含 P99/P999);
- 具备优秀的沟通与跨团队影响力,能在高压下进行风险评估与快速决策;坚持安全与合规,推动可靠性文化落地。