岗位职责
- 设计并实施系统和应用程序的监控、日志记录和追踪方案;
- 开发和维护可观测性平台工具和仪表盘,提供实时的系统健康和性能可视化;
- 分析和优化系统的性能和可靠性,通过监控数据和追踪信息识别瓶颈和故障点;
- 与开发团队协作,确保应用程序在开发过程中充分考虑可观测性需求;
- AI 工程化基础:熟悉大模型相关技术架构,包括但不限于 Prompt Engineering、RAG (检索增强生成)、LangChain 或 LlamaIndex 等开发框架
- 模型评估逻辑:了解如何评估 LLM 在特定运维任务中的表现(如准确率、幻觉控制、响应时延优化等)
职位要求
- 2027届毕业生,本科及以上学历,计算机、软件工程相关专业;
- 具备良好的编程基础,熟悉一种或多种编程语言(如 Java、Go、Python、Rust 等);
- 了解分布式系统原理,并对微服务架构有一定的理解;
- 熟悉常见的监控和可观测性工具(如 Prometheus、Grafana、ELK Stack、Jaeger、OpenTelemetry 等);
- 具备良好的问题解决能力和沟通能力,能够与跨职能团队有效协作;
- 对新技术和新工具保持强烈的好奇心和学习热情; 加分项:
- 有实习或项目经验,特别是在大规模分布式系统领域;
- 在 AIOps 国际挑战赛、KDD Cup 等比赛中获奖,或在相关领域(如异常检测、自动诊断)发表过论文。