岗位职责
- 负责火山引擎超大规模监控平台的架构设计与开发,打造的监控系统,服务内部业务海量业务与火山引擎To B客户;
- 负责海量时序数据的写入、存储、查询链路研发与优化,构建高吞吐、低延迟、低成本的监控数据底座;
- 负责监控系统的平台化建设包括SLO,优化用户各类自定义监控告警需求;
- 负责智能运维监控方向的演进,挖掘基础监控的数据,构建智能监控模型(AIOps)。
职位要求
- 本科及以上学历,计算机相关专业,2年以上系统开发或监控系统开发项目经验;
- 熟练Go/Java/Python中至少一门,深入理解Linux,精通TCP/IP、HTTP协议,熟悉gRPC/Thrift/bRPC之一;
- 熟悉常见存储与消息中间件(Redis/MySQL/Kafka/RocketMQ等),理解其原理与适用场景;
- 具备高并发、高可用分布式系统的设计经验,对稳定性与质量有高标准要求;
- 能够独立完成工作,具有较强的综合分析问题及解决问题的能力;
- 具备良好的学习能力与判断力,对新技术及前沿发展方向保持积极学习态度。 具备以下条件之一者优先
- 熟悉主流监控系统(Prometheus、OpenFalcon、Zabbix等)源码或架构;
- 熟悉时序数据库(VictoriaMetrics、InfluxDB、OpenTSDB、Prometheus TSDB等)原理或源码;
- 有APM、分布式链路追踪(OpenTelemetry/SkyWalking/Jaeger)相关经验;
- 有高可用系统稳定性建设(容灾、限流、自愈)经验;
- 具备智能运维监控(AIOps)相关经验者优先。