岗位职责
我们是阿里巴巴智能引擎事业部模型优化团队,负责集团深度学习模型和 LLM 模型的推理性能优化与系统演进。在这里你将负责: ● 支撑淘宝、天猫、AIDC、高德等阿里巴巴集团业务的千亿级模型推理请求,是深度学习与大模型推理优化的前沿阵地; ● 研发高性能大模型推理引擎,围绕算子优化、请求调度、缓存管理和计算通信协同开展端到端优化,持续突破吞吐、时延与资源效率边界; ● 面向ScalingUp持续升级深度学习推理系统架构,重塑特征、模型的深度协同,支持百万级超长序列、TB级Embedding、数百亿参数规模的Dense网络的下一代搜索推荐深度学习模型。 ● 推动模型、系统与硬件协同优化,充分释放异构算力潜能,建设高性能、高稳定、可演进的模型推理基础设施。
职位要求
我们期望你: ● 精通 C++,熟悉 Python,具备优秀的系统设计、开发、调试与性能优化能力; ● 熟悉 PyTorch 等深度学习框架及主流模型的推理过程,了解 GPU 架构与编程模型,具备系统性能分析与优化能力; ● 具备良好的工程素养和问题解决能力,追求极致的系统性能与代码质量。 以下任一经验加分: ● 熟悉 vLLM、SGLang、TensorRT-LLM 等主流大模型推理框架的架构与核心实现,有源码阅读、功能扩展或性能优化经验; ● 具备搜索推荐在线推理引擎研发经验,在高并发低延迟服务、内存管理、特征访存或大规模生产系统等方面有一定的技术积累。