岗位职责
- 负责大模型推理服务的调度与性能优化,提升首 Token 延迟、Decode 延迟、吞吐、显存利用率和 GPU 利用率;
- 负责推理请求调度、动态 Batching、KV Cache 管理与调度、显存管理等等推理性能与效率的核心能力建设;
- 负责分布式推理优化,结合模型结构、硬件资源和业务流量特点,优化 TP/PP/EP 等推理策略;
- 负责推理引擎优化,围绕模型加载、算子执行、CUDA/GPU 性能、并发执行等方向持续提升推理性能和稳定性;
- 跟进并引入 LLM Serving、推理引擎、分布式推理、GPU 性能优化等前沿技术,推动推理平台持续演进。
职位要求
- 本科及以上学历,计算机、人工智能、电子、自动化、软件工程等相关专业,有大模型推理系统优化经验者优先;
- 熟练掌握 Linux 环境下 C/C++/Rust/Python/等 1 至 2 种以上语言;
- 熟悉 LLM 推理基本流程,理解模型加载、Prefill、Decode、Serving、Batching、调度、并发控制、显存管理、KV Cache、分布式推理等核心机制以及相关优化实践;
- 熟悉 TensorRT-LLM、vLLM、SGLang、Triton Inference Server、ORCA 等主流推理框架、推理引擎或调度机制;
- 具备良好的性能分析和系统优化能力,能够定位推理链路中的调度、显存、算子、通信和资源利用率瓶颈;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应线上问题并推动解决。