岗位职责
- 参与大模型训练、推理核心算子的设计、开发与性能优化,覆盖Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等关键算子,支撑千亿/万亿参数模型的低延迟、高吞吐推理;
- 面向NVIDIA、AMD及其他通用AI加速硬件,研发高性能Kernel实现方案,充分利用Tensor Core、Shared Memory、异步流水、Persistent Kernel等硬件能力,持续提升算子吞吐、延迟和资源利用率;
- 参与FP
- FP
- INT
- INT4等低比特推理相关算子研发与优化,推动量化算子、算子融合、图级优化与推理框架协同落地,降低端到端推理成本;
- 针对线上真实负载开展系统化性能分析、Benchmark、性能归因与问题定位,解决算子性能瓶颈、稳定性和工程化落地问题,沉淀可复用的优化方法和工程实践。
职位要求
- 精通C++/CUDA/Python,具备扎实的计算机体系结构、并行计算和高性能计算基础,能够独立完成复杂GPU Kernel的设计、实现、调优和工程化落地;
- 深入理解GPU硬件架构与性能优化方法,熟悉Tensor Core、Memory Hierarchy、Shared Memory、Register、Warp Scheduling、异步流水等机制,具备系统化性能分析和瓶颈定位能力;
- 熟悉大模型推理核心算子,包括Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等,有实际优化经验者优先;
- 熟练使用Nsight Compute、Nsight Systems、Nsys等性能分析工具,能够针对真实业务负载开展性能归因、Benchmark建设和端到端优化;
- 熟悉Triton、CUTLASS/CuTe、FlashAttention、FlashInfer、TensorRT-LLM、vLLM、SGLang等生态中的任一技术栈,有开源贡献或生产级优化经验者优先。