岗位职责
- 新一代多模态推理架构设计与开发:面向极其庞大且复杂的线上流量,设计并实现支持海量异构算力的高效全局调度系统;解决真实高并发场景下的计算负载均衡与极致的Batch组装难题;
- 超大规模推理引擎深度优化:面向千亿级(200B+)超大模型以及复杂的视觉语言模型(VLM),开发并优化分布式推理策略(TP/EP/DP等);在生产环境中突破内存与算力瓶颈,实现业界领先的吞吐量与超低延迟;
- 前沿模型算子级优化:针对前沿业务模型架构(如MoE、各类新型Attention机制、多模态融合层等),开发并打磨高性能底层算子(CUDA/Triton等),深度挖掘硬件潜力;
- AI驱动的基础设施(AI for AI Infra):探索AI Agent在系统性能调优、全链路一致性校验、部署流水线中的落地,构建高度智能化的大模型服务与运维体系,AI Agent for Kernel Optimization。
职位要求
- 具备2年以上高性能计算、分布式调度系统或大模型推理引擎开发经验,熟悉大模型模型结构;
- 对业界前沿的大模型推理框架(如vLLM、SGLang等)的底层源码有深入理解,具备生产环境下的定制开发与性能调优经验;
- 具备较强的复杂系统架构设计能力,对高并发微服务系统中的异步调度、资源池化、负载均衡有深刻理解与实战经验;
- 熟悉GPU底层微架构,熟练使用CUDA、Triton、CUTLASS等工具进行算子级别极限优化者优先;
- 有大语言模型优化(PTQ/QAT/KV Cache优化/PD分裂)或多模态模型(VLM)线上工程落地经验者优先。