岗位职责
现代大模型推理系统的主流设计——连续批处理、分页显存管理、PD分离——均建立在一个隐含假设之上:请求是相互独立的原子任务,且具有相对短暂、可预期的生命周期。 尽管先进的Serving引擎通过前缀树索引等机制已将全局KV Cache命中率推高至90%,但智能体负载正在使底层调度假设系统性失效:一个任务横跨数十轮交互,上下文单调增长并穿插异步工具调用,导致“会话”取代“请求”成为真实的资源消耗主体。这种高命中率掩盖了致命的结构性危机:为维持命中率的“盲目驻留”导致显存被长尾状态锁死;系统在显存物理耗尽之前,极易在局部的“逐出—重算”循环中陷入Thrashing瘫痪;且缺乏价值评估的平权缓存,使得优化目标无法从单请求延迟真正跃迁至会话级任务经济性。近两年前沿研究仅点状触达缓存压缩或形态转换,却无人解决状态资产管理与全局负载治理的深度耦合——这正是本项目的切入点. 围绕“上下文存续需求单调增长与系统承载资源有界”的核心矛盾,本项目部署两个研究方向:
- 上下文状态的资产化管理:打破平权缓存,建立状态价值的统一度量:V(state) = 期望避免的未来重算成本 − 持有成本 − 迁移成本 − 形态转换成本,重点刻画价值的负载依赖性,实现负载感知的动态定价;构建“原始 KV → 压缩 KV → 语义摘要 → 丢弃待重算”的状态形态连续谱系,让高价值状态获得更高存储层级。
- 有状态负载的闭环治理:治理单元从请求升级为会话,建立资源画像与会话级服务目标;设计调度、降级多时间尺度控制环,共享同一份系统状态估计;核心贡献在于状态与负载的协同控制——价值模型向治理环暴露状态压力指数,治理决策反过来实时修正价值模型的负载参数,使系统在90%以上的高水位显存压力下,贴着 Thrashing 临界点稳定运行于最大有效吞吐。
职位要求
- 计算机科学、人工智能、电子工程或相关专业博士;
- 精通 PyTorch 框架,具备良好的代码工程能力;
- 熟悉大模型推理架构,深入理解PagedAttention及Radix Tree机制、分布式KV存储、长上下文显存管理、Chunked Prefill调度器、推测解码等技术原理;
- 在 OSDI / SOSP / EuroSys / MLSys / ASPLOS / NeurIPS / ICML / ICLR 等顶级会议发表过相关论文者优先;
- 具备优秀的科研创新能力、问题抽象能力与跨团队协作精神。