岗位职责
- AI基础设施平台研发:参与/负责面向大规模GPU集群、分布式存储与高性能网络的资源管理、调度、配额、隔离等平台能力建设,支持万卡级训练与大规模推理场景;
- 资源效率与成本优化:围绕GPU利用率、显存/算力/存储/带宽等关键指标,构建可观测体系并推动调度策略、混部、弹性伸缩、潮汐复用等优化方案落地;
- 稳定性体系建设:建立覆盖容量、变更、故障、应急的稳定性体系,主导/参与SLO定义、容量规划、故障演练、应急预案、Postmortem等工作,持续降低MTTR与故障影响面;
- 研发体系标准化:沉淀AI训练/推理/数据流水线的研发规范、模板与工具链(CI/CD、版本管理、环境管理、镜像管理、配置管理等),推动跨团队研发流程的统一与提效;
- AIOps智能运维:基于平台大盘指标、日志、Trace、事件等数据,建设异常检测、告警降噪、根因定位、容量预测、自动化处置等智能运维能力;探索大模型/Agent在AI Infra运维场景的落地。
职位要求
- 本科及以上学历,计算机、软件工程、人工智能等相关专业;3年以上后端研发工作经验;
- 扎实的编程功底,熟悉Go/Python/Java中至少一门,具备良好的工程架构与代码质量意识;熟悉Python Flask、Celery、DjanGo、Tornado、NumPy等框架和库使用或熟悉Golang BeeGo、Gin、Gorm、Sarama,gRPC-Go等常见开源框架;
- 熟悉分布式系统、微服务架构,了解可观测性体系(OpenTSDB、Prometheus、Grafana、ELK、OpenTelemetry等),OLAP数据库ClickHouse使用;
- 具备以下任一方向经验者优先: 1)时序异常检测、告警降噪、根因分析等AIOps算法落地经验; 2)大模型/RAG/Agent应用开发经验; 3)监控、日志、Trace数据处理与平台建设经验;
- 良好的问题分析与解决能力,较强的沟通协作能力和主动性,能在复杂系统中快速定位与解决问题。