岗位职责
- 面向token efficiency的架构探索与设计:针对视频 Diffusion及生成-理解统一架构,探索在同等精度下显著降低训练与推理开销的架构方案,包括但不限于稀疏注意力(block-sparse、时空局部窗口、可学习稀疏模式)、Latent Moe、Attention Residual、Muon优化器变种等的探索;面对超长序列问题,从算法与系统两侧联合给出可扩展的注意力与架构方案,并以严谨的消融实验量化每项改动的精度-效率收益;
- 训练与推理吞吐优化:以 MFU、单位算力产出为核心指标,推动Co-design 优化:设计并落地低精度训练方案(BF16/FP8 混合精度、细粒度量化 scaling、数值稳定性监控),建立配套的精度回归评估体系,给出精度、吞吐、显存之间可量化的 trade-off 结论;
- Scaling 效率研究:研究优化器变种(如 Muon等二阶方法)与超参迁移方法在 Diffusion 训练中的适用性;结合数据配比与数据利用效率实验,设计小规模代理实验并外推,为"同样算力如何训出更强模型"提供可复用的 scaling 结论,支撑下一代模型的 compute-optimal 决策;
- 高性能训练系统实现:把架构与算法设计落进生产训练系统:编写或调优关键算子(CUDA/CUTLASS),设计与序列形态、稀疏模式匹配的并行方案(FSDP/TP/CP/EP 及其组合),实现通信-计算 overlap 与显存峰值控制;用 Nsight Systems/Compute、torch profiler 等工具对训练全链路做性能分析,持续定位并消除瓶颈,保障大规模训练的稳定与高效。
职位要求
- 计算机科学、人工智能、数学或相关专业硕士及以上学历;
- 扎实的深度学习基础,理解 Diffusion / Flow Matching 的建模与训练原理,熟悉 DiT 类架构的计算特征;对生成式模型的效率瓶颈(注意力复杂度、超长序列、显存压力)有第一手认知;
- 较强的算法工程化能力:熟练使用 CUDA/C++ 或 Triton/CUTLASS,理解 GPU 执行模型与存储层级,有 attention/GEMM 级别的算子编写或调优经验,能用 roofline 等方法判断算子的性能上限与优化空间;
- 熟悉 PyTorch 及至少一种大规模训练框架(Megatron-LM/FSDP/DeepSpeed 等),理解 DP/TP/PP/CP/EP 各类并行策略的通信语义与适用边界,有数百卡及以上规模的训练实践,能独立完成从算法设计到 Infra 落地的全链路开发;
- 在模型量化、稀疏化、算子融合等方向至少一个领域有深入积累,能在精度、吞吐、显存、研发成本等多重约束下给出可量化的 trade-off 分析与决策;
- 良好的科研能力与技术品味:能快速复现并批判性评估前沿论文,判断其在业务规模下的适用边界,并结合实际约束改进落地。 加分项:
- 在 CVPR/ICCV/ECCV、NeurIPS/ICML/ICLR,或 MLSys/OSDI/ASPLOS 等系统方向顶会发表过相关论文;
- 有大规模生成模型(视频/图像/多模态)训练提效或推理加速的完整落地案例,能清晰量化优化前后的收益;
- 深刻理解 GPU 体系结构(SM 与 Tensor Core、寄存器/共享内存/HBM 存储层级、NVLink 互联与集合通信),了解并实践过 Hopper/Blackwell 代际的新硬件特性(如 TMA、FP8/FP4 Tensor Core);
- 参与过主流开源项目(PyTorch、Megatron-LM、FlashAttention、vLLM/SGLang、xDiT 等)的开发,或有高质量的个人开源作品;
- 有超长序列训练(context/sequence parallel、ring attention)、MoE 训练系统(专家并行、负载均衡、通信优化)或视频生成模型加速的实战经验。