岗位职责
专注于超大规模分布式LLM推理系统的研究、探索和开发,具体职责包括:
- 探索高性能的、可扩展的分布式LLM推理引擎,支持超大规模LLM的高效部署;
- 深入优化高性能算子、运行时、分布式策略等,打造业界领先的LLM推理引擎;
- 分析现有引擎和典型负载的性能瓶颈,提出并实现创新的优化技术;
- 结合阿里云PAI平台产品服务,提供可靠高效的引擎技术方案,支持客户加速模型推理;
- 针对LLM重点场景构建业界领先的优化解决方案。
职位要求
- 扎实的工程能力,优良的编程风格,熟悉Python/C++语言和常用设计模式,具备复杂系统的设计开发调试能力;
- 优良的沟通表达能力、团队合作意识和经验;具备快速学习的能力,以及深入钻研技术问题的耐心;
- 熟悉计算机体系结构基础知识,有扎实高性能计算(GPU/x86/ARM等)、或推理框架、或模型算法优化(量化/稀疏等)方面的经验; 加分项:
- 有突出的学术背景和创新研究能力;
- 对LLM等重点场景的系统优化或前沿算法有深入务实的经验;
- 具有GPU高性能Kernel开发和优化经验。