岗位职责
- 负责面向大模型推理场景的通用后端运行时系统研究与架构设计,核心目标是构建引擎无关的系统层,统一管理推理进程状态、模型权重生命周期与GPU设备资源;
- 研究并优化推理进程的高效快照与恢复机制,在Linux CRIU基础上针对GPU推理进程进行深度定制,推动关键路径逼近PCIe/RDMA硬件带宽极限;
- 设计模型权重的跨进程、跨实例共享机制,支撑多模型混部、热升级、弹性扩缩容等生产场景下的零拷贝权重复用;
- 与百炼推理平台团队紧密协作,将后端运行时能力落地到模型上下线、故障恢复、跨可用区调度等真实业务链路,形成可量化的成本与弹性收益。
职位要求
- 2027届毕业生,计算机科学、软件工程或相关专业,研究方向涉及操作系统、高性能计算或AI基础设施
- 扎实的系统编程能力,精通C/C++,对Linux内核机制(进程管理、内存管理、cgroup/namespace)有深入理解
- 熟悉以下至少一项:进程checkpoint/restore(如CRIU)、GPU编程与CUDA Runtime内部机制、容器/虚拟化技术、高性能I/O(RDMA/DMA/PCIe)、推理框架(如SGLang)、kvcache(如Mooncake) 加分项:
- 在OSDI/SOSP/EuroSys/ATC/ASPLOS/NSDI等系统顶会有论文发表;
- 有CRIU、Linux内核、GPU驱动或虚拟化相关的开源贡献经验;
- 熟悉LLM推理系统架构(vLLM/SGLang/TRT-LLM),理解推理进程的运行时行为特征;
- 有GPU显存管理、CUDA VMM、Multi-Process Service等GPU系统层面的研发经验。