岗位职责
- 主导高扩展性、高吞吐量AI基础设施平台的设计与构建,基于VLLM、SGLang等前沿推理框架,搭建支持多模态大模型的分布式推理系统,实现动态资源调度与低延迟响应
- 构建智能化资源调度策略与弹性扩缩容机制,保障高并发场景下推理服务的稳定性与资源利用率最大化
- 解决大规模分布式场景下的性能瓶颈,优化GPU集群资源利用率及端到端推理吞吐量,降低推理成本并提升TTFT、TPOT等指标
- 跟踪AI基础设施领域(AI Infra)技术趋势,包括但不限于分布式推理优化、模型即服务(MaaS)、自动化模型部署(AutoML)等,结合业务场景进行技术选型与创新性实践
- 设计并实现AI推理服务效能监控看板与端到端可观测性(Observability)系统,通过实时指标分析(如token消耗、GPU利用率、延迟分布)驱动业务侧资源优化。
- 构建数据驱动的A/B测试与成本分析模型,为业务决策提供量化依据,助力模型服务化全生命周期管理。
职位要求
- 硕士及以上学历,计算机科学、人工智能等相关专业,具备3年以上AI基础设施或大规模分布式系统研发经验
- 精通Python/C++/Go等至少一种编程语言,具备扎实的分布式系统设计能力
- 深入掌握Kubernetes集群的高可用架构设计与大规模运维,熟悉容器编排、存储优化及网络性能调优方法论
- 熟悉VLLM、SGLang等推理框架的底层机制,有基于LLM的向量化推理、动态批处理或模型并行优化经验者优先
- 熟练掌握Prometheus、Grafana、OpenTelemetry等可观测性工具链,具备复杂故障场景的根因分析能力