岗位职责
-负责自动驾驶大模型在 NVIDIA GPU 上的推理算子研发与极致加速 -设计与优化支持千卡级别的分布式训练框架,提升集群整体的训练吞吐量与稳定性 -针对大模型结构进行显存优化、算子融合(Kernel Fusion)及通信性能(如 NCCL)调优 -追踪业界最新的 AI Infra 技术(如 Triton、vLLM、Megatron),并推动其在团队业务中的落地部署
职位要求
-硕士及以上学历,计算机体系结构、高性能计算等相关专业,精通 C/C++ 与 CUDA 编程 -深入理解底层硬件架构,熟悉并行计算、分布式系统原理或深度学习编译器(如 TVM/TensorRT) -有深度学习框架底层开发经验,或向核心开源社区(如 PyTorch, Triton)贡献过代码者优先