岗位职责
- 负责应用网络可观测平台的产品规划、路线设计与持续迭代,覆盖客户端、DNS、CDN、四层负载均衡、七层网关、服务端及跨地域网络链路等场景;负责需求调研、方案评审、原型设计、项目推进、上线验收和效果评估,对产品使用率、故障定位效率、告警有效性等结果负责;
- 建设端到端应用访问链路观测能力,打通“用户请求—网络路径—流量调度—服务响应—异常定位”的数据闭环;
- 建设面向运维与研发的诊断体验,支持从业务现象快速下钻至域名、链路、节点、实例、接口或具体请求;
- 推动日志、指标、Trace、流量数据、拨测数据等多源数据关联,形成统一的数据模型与分析视图;
- 结合AI Agent、智能诊断、自动化处置等方向,探索应用网络运维从“监控告警”向“主动发现、辅助决策、自动恢复”演进。
职位要求
- 3年及以上To B、云计算、基础架构、可观测、运维平台或网络产品经验,有互联网或云计算平台经验优先;
- 熟悉应用网络链路及典型组件,包括DNS、CDN、TCP/UDP、HTTP/HTTPS、四层负载均衡、七层代理、服务网格、API Gateway、正向代理、长连接等;
- 理解可观测性基本方法论,熟悉Metrics、Logs、Traces、Events、Flow等数据类型及关联分析方式;
- 能够独立完成复杂平台型产品的需求拆解、信息架构设计、数据指标设计和交互方案设计;
- 具备较强的数据分析能力,能够从流量、时延、错误率、可用性、容量等数据中识别问题并定义产品机会。 加分项:
- 有APM、可观测平台、NPMD、网络监控、CDN、负载均衡或云网络产品经验;
- 熟悉OpenTelemetry、Prometheus、eBPF、Service Mesh、SkyWalking、Jaeger、Grafana等相关体系或产品;
- 有流量调度、全球网络、跨Region服务治理、边缘网络或多云网络场景经验;
- 有告警降噪、故障事件管理、AIOps、根因分析或Runbook自动化相关经验;
- 有AI Agent、智能运维、自然语言数据分析或自动化诊断产品落地经验。