岗位职责
该职位专注于分布式大语言模型 (LLM) 推理系统的底层基础设施研究与探索,包括GPU和RDMA等。主要职责包括: 探索高性能、可扩展的分布式LLM推理引擎,以支持分布式LLM的高效部署; 基于KVCache,对大模型框架进行深入优化; 分析现有推理框架的性能瓶颈,提出并实施创新的优化技术; 参与与大模型相关的开源项目,如mooncake、vllm等。
职位要求
扎实的工程能力和编程风格,熟悉Python/C++语言和常用设计模式,具备复杂系统的设计、开发和调试能力; 优秀的沟通表达能力和团队合作意识,具备快速学习的能力以及深入钻研技术问题的耐心; 熟悉计算机体系结构基础知识,并在高性能计算(如GPU/x86/ARM等)、推理框架或模型算法优化(如量化/稀疏等)方面有扎实经验。 加分项: 拥有出色的学术背景和创新研究能力; 在LLM等关键场景的系统优化或前沿算法方面有深入而务实的经验; 具有RDMA或GPU开发和优化的经验。