岗位职责
- 参与大模型推理框架和分布式Serving系统的核心研发,面向语言模型、多模态模型和Agentic应用场景,建设高性能、高稳定性、高扩展性的生产级推理引擎;
- 研发并优化Prefill/Decode分离、KV Cache管理、长上下文推理、多租户调度、连续批处理、SLO感知调度等核心系统能力,提升TTFT、TPOT、吞吐和资源利用率;
- 参与分布式推理并行与通信优化,包括Tensor Parallel、Pipeline Parallel、Expert Parallel、Context Parallel、MoE All-to-All、跨机通信重叠、负载均衡和故障恢复等;
- 协同算子、模型压缩、模型算法和业务团队,推动量化、投机解码、MoE优化、多模态推理、长上下文优化等能力在推理框架中生产落地,解决线上性能、稳定性和成本优化问题。
职位要求
- 精通C++/Python,熟悉CUDA编程和GPU推理系统开发,具备扎实的系统软件、分布式系统、并行计算和高性能服务端开发基础;
- 深入理解大模型推理框架核心机制,包括Prefill/Decode、KV Cache管理、Continuous Batching、PagedAttention、Speculative Decoding、Quantization等;
- 熟悉分布式推理并行与通信优化,包括Tensor Parallel、Pipeline Parallel、Expert Parallel、Context Parallel、MoE All-to-All、通信计算重叠、负载均衡等;
- 熟悉GPU间和跨节点通信机制,了解NCCL、RCCL、MPI、UCX、RDMA、InfiniBand、NVLink、NVSwitch、PCIe等相关技术,具备端到端性能分析和问题定位能力;
- 熟悉vLLM、SGLang、TensorRT-LLM等推理或服务框架,有核心模块开发、深度改造或生产级落地经验者优先。