岗位职责
- 背景:我们正在寻找专注于大模型推理优化的工程师,负责游戏业务中线上大模型服务的性能优化。您将参与从推理引擎优化到异构硬件落地的全流程,在低延迟、高吞吐的场景中支撑游戏大模型的在线推理服务,作为核心技术中台支持不同游戏项目的落地需求;
- 推理性能优化:围绕首 Token 延迟(TTFT)、生成吞吐、显存与算力利用率进行极致调优;应用量化(FP
- INT4/AWQ、MXFP4 等)、稀疏化等压缩技术,在维持模型推理效果的前提下降低推理成本;
- 推理引擎与算子优化:基于 vLLM、SGLang、TensorRT-LLM 等主流框架进行二次开发与深度优化,涉及连续批处理、PagedAttention、前缀缓存、KV Cache 量化与分级存储等关键能力;结合 CUDA/Triton 进行算子融合与计算图编译优化;
- 推理架构演进:探索 PD 分离、投机解码、MoE 专家并行等前沿架构,优化长上下文、长思维链与高并发场景下的推理效率;
- 算力适配:负责推理服务在算力上的部署、适配与调优,开展算子适配、显存管理与通信优化,构建跨硬件、可复用的推理加速方案;
- 性能分析与持续优化:建立推理服务的分析与监控体系,使用 Nsight 等工具进行 profiling 与瓶颈定位,监控推理服务的算力资源使用效率;与模型、agent、游戏引擎等多团队协作,结合游戏研发与运营的实际需求,持续优化推理成本。
职位要求
- 教育背景:硕士及以上学历,计算机、软件工程、人工智能或相关专业;在大模型推理优化、GPU 性能调优方向有丰富经验者优先;
- 技术能力:;
- 精通 Python 与 C++,熟悉 Linux 开发环境,具备扎实的系统编程与算法基础;
- 熟悉 PyTorch 等深度学习框架,深入理解 KV Cache、量化、前缀缓存等大模型推理优化机制;
- 有 CUDA 编程或 GPU 性能调优经验,能使用 Nsight 等工具进行 profiling;
- 熟悉主流推理框架(vLLM、SGLang、TensorRT-LLM 等),有二次开发或深度优化经验。