岗位职责
- 高效Attention设计: 探索新一代注意力实现机制, 包括但不限于: Sparse/Quant-Attention, Linear-Attention, Mamba等, 破除 Attention 计算平方复杂度限制, 推进新一代大模型推理极限;
- 量化加速: 探索NV-FP4 / INT4 等低bit 精度的量化后训练(QAT) 和KV-cache 压缩, 优化模型计算效率的同时保证模型的效果无损;
- 投机推理: 致力于提升Auto-Regressive 模型的生成效率, 利用draft-verify 机制实现低成本token 生成,追求极致的接收率和突破更高的接收长度。
职位要求
- 硕士及以上学历,数学、计算机、自动化、电子等专业优先;
- 熟悉Transformer结构及其变种, 熟悉Attention的设计和多种变种实现, 熟练使用Triton / TileLang 等工具;
- 数理要求: 熟练掌握 线性代数, 概率率和矩阵论;
- 有较强的自驱力和学习力,对生成式模型有强烈的兴趣; 加分项:
- 有 NIPS/ICLR/ICML/CVPR 等顶会发表经历者优先。