岗位职责
- diffusion步数蒸馏和CFG蒸馏: 1)跟进学术界最前沿的 few-steps diffusion 算法, 探索研发 one-step / few-steps 的无损蒸馏算法, 包括但不限于 consistency modeling、shortcut、score distillation等方案, 打造实时化的极致高效视频/图像大模型; 2)研究 DPO/GRPO/PPO 等强化学习的手段在少步模型下的新训练算法, 摸索强化学习与压缩算法的化学反应, 推动效果-效率的帕雷托前沿新SOTA;
- transformer模型架构优化: 1)跟进学术界高效attn 计算成果(包括但不限于: sparse-attn, linear-attn 等), 探索研究视频模态下较full-attn 的无损高效attn方案; 2)量化后训练: 探索极低bit 的量化训练(QAT), 特别是针对FP8/FP4 的无损量化加速。
职位要求
- 硕士及以上学历,数学、计算机、自动化等专业优先;
- 熟练掌握diffusion原理, 具备公式推理和证明的能力, 有过相关的研究经历和实践经验者优化;
- 熟悉transformer结构及其变种, 熟悉attention的设计和多种变种实现, 掌握triton;
- 数理要求: 熟练掌握线性线数、概率论、信息论、凸优化等基础知识,了解矩阵论、随机过程等;
- 有较强的自驱力和学习力,对生成式模型有强烈的兴趣。