岗位职责
- 负责AI模型的网络级压缩与优化,涵盖量化(QAT/PTQ)、投机采样(Speculative Decoding)、Token压缩、知识蒸馏等技术;
- 针对大小模型设计并实现差异化量化方案,如小模型的KL散度、Percentile、AdaRound等,大模型的SmoothQuant、AWQ等;
- 参与模型网络结构的优化与重构,将现有网络的算子、Block替换为高效、硬件友好的架构;
- 参与模型训练与微调,能够复现、分析并改进前沿模型结构;
- 与硬件团队紧密合作,提供模型优化视角的硬件设计建议,推动下一代芯片对新型算子与网络结构的支持。
职位要求
- 计算机科学、人工智能、数学等相关专业硕士及以上学历;
- 深入理解模型量化技术(PTQ/QAT),至少熟悉一种小模型或大模型量化方案,并有实际部署经验;
- 熟悉大模型推理优化技术,如投机采样、Token剪枝、稀疏化等;
- 具备较强的模型训练与复现能力,能够阅读论文并快速实现网络结构改进;
- 了解芯片计算特性;
- 代码能力强,熟练使用PyTorch/TensorFlow等框架,熟悉底层算子开发(如CUDA kernel)者更佳。