岗位职责
- 推理服务全链路稳定性:负责 MaaS 推理服务(网关/调度/协议适配/引擎)的可用性与性能,主导 SLA 定义与达成,落地容量水位管理与反压(限流/熔断/优先级调度)机制,保障高并发下服务稳定;
- 推理性能与效率深度优化:定位并优化 TTFT/TPOT/吞吐/首包时延等核心指标瓶颈,深入推理引擎(vLLM/SGLang/TensorRT-LLM 等)的批调度、KV Cache、量化与并行策略,联合研发持续提升单卡与单节点产出;
- 多站点与容灾架构:设计并落地多可用区 / 多站点条带化部署架构与切流方案,主导故障演练与 AZ 级切换,消除跨 AZ 带宽与单点风险;
- 成本与容量运营:建立推理服务的容量量化模型(TPM / 水位 / 单副本承载力),基于真实压测数据做资源规划与成本优化,提升 GPU 资源整体利用率;
- 运维自动化与智能化:建设推理服务的可观测体系(指标 / 链路追踪 / 日志)与排障自动化能力,探索基于 AI Agent 的根因归因、自动巡检与自愈;前沿技术跟踪:跟踪大模型推理加速、异构算力、新型集合通信等方向,推动在业务中落地。
职位要求
- 本科及以上学历,3 年以上工作经验,其中至少 1 年大规模在线服务(推理 / 训练 / 高性能计算)SRE 或平台运维经验;
- 熟练掌握 Go / Python / Shell 中一种或多种语言,具备开发生产级自动化工具与运维平台的能力。熟悉容器技术,掌握 K8s、Docker 的技术原理(调度器/网络/存储/探针),有 GPU 容器化(Device Plugin、拓扑感知调度、共享 GPU)的实际运维经验;
- 深入了解 GPU 架构与并行计算:熟悉 GPU 显存层级与带宽特性、SM 与算子执行模型,掌握 CUDA 编程实践;熟悉 RDMA 网络通信、NCCL 集合通信,能独立排查通信 hang / 降级 / 带宽不达预期问题;理解大模型分布式推理与训练架构及模型压缩 / 量化技术;
- 熟悉主流推理引擎与serving框架(vLLM / SGLang / TensorRT-LLM / Triton 等)的内部机制,理解 Continuous Batching、PagedAttention、投机解码等关键优化手段,具备实际调优经验;
- 具备较强的架构抽象与问题拆分能力,能将复杂业务系统拆解为可度量、可治理的单元;
- 良好的沟通协调与团队协作能力,责任心强,具备一定抗压能力。