岗位职责
- 模型训练优化:主导智能驾驶全栈模型(感知/BEV融合/预测/规划)服务器端训练优化,落地混合精度训练、结构化稀疏化、梯度压缩技术,平衡模型精度、训练效率与服务器资源开销;构建训练性能基准体系与自动化调优/测试管线,支撑规模化训练迭代;
- 集群分布式优化:攻坚自动驾驶PB级多传感器数据的集群分布式训练,优化跨节点RDMA/TCP通信、低延迟序列化与动态拓扑;适配GPU/国产AI芯片集群,通过数据分片、混合并行(数据+模型+张量+流水线)、通信-计算重叠,突破传输瓶颈,保障训练稳定性。
职位要求
- 5年以上AI领域实战经验,3年以上智能驾驶服务器端训练优化经验,主导过工业级集群训练项目,有可验证成果;
- 精通C++/Python高性能编程,深入理解PyTorch/TensorFlow内核与分布式训练逻辑(DDP/DeepSpeed ZeRO),具备神经网络优化、并行计算、多模态数据处理基础;熟悉BEV感知/3D检测等模型训练原理;
- 至少深耕任一方向:智能驾驶模型量化/稀疏化/梯度压缩及端到端集群训练优化,或集群架构设计/RDMA优化/混合并行策略/海量数据传输优化,或核心算子开发/TVM编译优化/服务器芯片指令集适配;
- 了解主流服务器AI硬件架构与指令集,熟练运用PyTorch Profiler/NVIDIA Nsight/国产Profiling工具等集群诊断工具,具备全链路瓶颈定位能力。