岗位职责
当前大语言模型(LLM)推理的快速发展推高了算力需求,推理过程中的 KVCache 技术所需的巨大显存消耗成为显著瓶颈。 目前亟需围绕KVCache的核心竞争力开展技术攻关,解决分级存储效率、动态调度策略、多级缓存协同等关键问题,以形成差异化的技术壁垒。 基于以上背景,本项目期望聚焦如下技术问题的研究:
- 面向大模型推理KVCache场景的分级(显存/内存/存储)缓存池及其多租SLO保障应用;
- KVCache缓存池的冷热数据分层和压缩等技术应用研究;
- 面向大模型推理的KVCache效果的仿真和模拟量化研究;
- 结合KVCache的AI融合记忆存储系技术研究。
职位要求
- 计算机或相关方向博士、硕士在读。扎实的工程能力,优良的编程风格,熟悉C++/Go/Python等1至2种语言;
- 熟悉大模型推理技术,熟悉至少一种推理引擎。熟悉分布式缓存/存储系统;
- 完成原型系统开发,相关技术经过验证,具有效果,具备合入产品的要求;同时具备清晰的设计文档,包括验证的方法、产品性能、业务落地可行性等报告;
- 发表CCF-A类或者领域内顶级会议、期刊论文,并申请相关专利。 加分项:
- 在数据库/存储/AI等顶会发表论文经验;
- 代码能力突出,有ACM等竞赛获奖经历;
- 参与过推理引擎或者存储系统的开源社区。