岗位职责
- 负责MaaS平台的整体架构设计,支持Chat、Embedding、Rerank等多种类型模型的高效托管与服务化。设计并实现智能模型路由(Model Router)机制,支持多模型版本灰度、AB测试、基于负载/成本/延迟的动态调度。
- 异构GPU集群管理: 负责模型服务在K8s环境下的自动化部署、扩缩容及生命周期管理。实现GPU池化,屏蔽异构GPU的差异。
- 推理性能优化:针对不同规格 GPU进行推理参数调优,实现算力资源的最优配置。深度优化vLLM、SGLang等主流推理框架,提升模型吞吐量(Throughput)并降低首字延迟(TTFT)。
- 服务治理与高可用:设计并实现针对推理场景的负载均衡策略,构建全方位的监控告警体系,覆盖 GPU 利用率、KV Cache 占用、Token 速率及 API 成功率等。
职位要求
- 基础能力:具备扎实的数据结构、算法及多线程/协程开发能力。
- 云原生与基础设施: 熟悉 Docker、了解 K8s Operator 或调度器扩展者优先。
- 推理框架经验:理解Transformer原理,熟悉TP/PP/EP/DP等并行推理技术,有vLLM、SGLang、NVIDIA TensorRT-LLM实际生产环境应用或二次开发经验者优先。
- 综合素质:对大模型技术栈(RAG、Agent)有热情,关注领域内论文。具备良好的系统化思维,能从监控数据中定位性能瓶颈。 加分项
- 有自研过模型路由层(Router)或 Gateway 经验,支持 Token 级流控与计费。
- 熟悉分布式推理(Tensor Parallelism / Pipeline Parallelism)。
- 有Embedding模型生产环境大规模优化经验