岗位职责
- 基于 PyTorch 生态(FSDP / DeepSpeed / Megatron 等)设计并实现 VLA 模型的分布式训练方案(DP / TP / PP / MoE),构建稳定高效的训练框架
- 推动混合精度(BF16 / FP8)与算子融合(FlashAttention / Triton kernel)
- 构建高吞吐数据pipeline,设计数据格式与 shard 策略,实现高效的数据加载
- 支持大规模实验追踪、管理、指标可视化
职位要求
- 扎实的 Python / C++ 基础,熟悉 Linux 系统
- 深入理解 PyTorch 分布式训练, 熟悉至少一种分布式训练优化框架(FSDP / DeepSpeed / Megatron)
- 深入理解 GPU / CPU / 内存 / 网络 基本原理
- 有大规模训练经验 加分项
- 有 多模态 / VLA / 机器人 / 自动驾驶 大规模训练经验
- 熟悉 NCCL / RDMA / InfiniBand 调优
- 有自定义 CUDA / Triton kernel 经验