岗位职责
岗位职责 1)推理调度系统:设计 batching / admission control / 请求调度策略,提升吞吐与稳定性; 2)KV Cache 系统:设计 cache 生命周期管理、复用策略与显存优化机制; 3)Decoding 优化:实现 speculative decoding / prefix reuse / 并行解码策略; 4)推理执行引擎:参与执行图、算子调度、runtime 优化; 5)GPU 利用率优化:分析 kernel、IO、调度瓶颈,提升整体利用率; 6)分布式推理:构建高并发在线服务,支持大规模请求负载; 7)训练协同:支持 RL rollout / evaluation 场景中的推理加速。
职位要求
1)扎实的编程能力(Python / C++ / Rust 至少一种); 2)良好的数据结构与算法基础; 3)理解操作系统、并发编程、网络基础; 4)具备性能分析能力(CPU / GPU / IO / 调度); 5)理解高并发系统设计(缓存、队列、负载均衡); 6)理解 Transformer 与大模型基本推理流程; 7)理解 KV Cache、batching、token streaming 等核心机制; 8)了解推理性能指标:延迟 / 吞吐 / 成本。 加分项 加分项(满足部分即可) 1)推理引擎经验(vLLM / TensorRT / SGLang); 2)推理优化经验(KV Cache / speculative decoding / PD 分离); 3)GPU 编程(CUDA / Triton)或 kernel 优化经验; 4)分布式系统或高并发服务经验; 5)大模型相关项目或开源贡献。