岗位职责
- 负责大模型训练、推理及平台服务的监控告警接收与处理,按SOP完成故障定位、响应与跟踪;
- 作为一线业务OnCall接口人,响应内外部客户的技术支持与问题排查,负责OnCall记录、交接班及问题升级;
- 支撑大规模批量推理任务的日常运维,包括实例管理、扩缩容、流量调配及异常恢复;
- 编写并维护运维SOP、OnCall手册、监控告警及应急预案,参与自动化工具建设,提升运维效率。
职位要求
- 2年以上运维或技术支持经验;
- 熟悉Kubernetes及云原生体系,具备集群运维和故障排查能力;
- 熟悉至少一种公有云平台(AWS/GCP/火山引擎等),了解GPU及异构计算基础,能进行GPU节点健康检查与问题排查;
- 熟悉Prometheus、Grafana等监控体系,具备扎实的Linux基础和网络知识;
- 熟练使用Python/Shell进行脚本开发与自动化相关工作;
- 能适应轮班及OnCall值班(含夜班及节假日)。