岗位职责
课题背景 随着大语言模型(LLM)、扩散模型在生成式AI领域的广泛应用,模型规模持续扩大,带来了高算力消耗、高显存占用、推理延迟高的问题,严重制约其在端侧、边缘设备及低算力场景的落地。本课题聚焦模型蒸馏压缩技术,重点针对扩散模型与大语言模型,通过蒸馏、量化、剪枝等技术手段,在尽可能保留原模型精度与生成效果的前提下,实现模型轻量化,降低部署成本,推动生成式AI技术的规模化、低成本应用。 课题挑战
- 精度与轻量化平衡的核心挑战:扩散模型的生成质量、大语言模型的语义理解与生成连贯性,对模型结构和参数依赖性极强,蒸馏过程中难以在大幅压缩模型体积(参数量、计算量)的同时,完全保留原模型的性能,易出现生成模糊、语义偏差、推理精度下降等问题。
- 针对性蒸馏策略设计难度:扩散模型与大语言模型的模型结构、训练逻辑差异显著,需设计差异化蒸馏方案,适配两类模型的核心特性,避免通用蒸馏方法导致的性能损耗,同时优化蒸馏效率。
- 工程化落地的技术瓶颈:蒸馏后的轻量化模型需适配不同部署场景(端侧、边缘、云端),需解决蒸馏过程中的训练稳定性、量化噪声、剪枝稀疏性带来的推理效率瓶颈;同时需兼顾蒸馏速度与模型泛化能力,避免过拟合,确保轻量化模型在复杂场景下的可靠运行。 具体工作
- 负责扩散模型、大语言模型的蒸馏压缩方案设计与实现,结合两类模型特性,选用合适的蒸馏策略(如知识蒸馏、自蒸馏、量化蒸馏),制定模型压缩目标(参数量、计算量、推理延迟)。
- 开展蒸馏模型的训练与优化,调试蒸馏温度、损失函数、蒸馏节奏等关键参数,解决蒸馏过程中精度下降、训练不稳定等问题,确保轻量化模型与原模型性能差距控制在可接受范围。
- 配合工程团队,完成蒸馏后模型的量化、剪枝等后续优化,适配不同部署场景的需求,测试模型推理速度、显存占用情况,输出工程化落地方案;跟进模型蒸馏领域前沿技术,迭代优化蒸馏策略,提升压缩效率与模型性能。
职位要求
- 熟悉深度学习基础理论,掌握模型蒸馏核心原理,了解扩散模型(如Stable Diffusion)、主流开源大语言模型的基本结构
- 熟练使用Python编程语言,掌握PyTorch/FSDP等深度学习框架,能独立完成模型训练与调试
- 具备良好的逻辑思维能力、问题解决能力,对模型加速、蒸馏方向有浓厚兴趣,愿意主动学习前沿技术
- 熟悉模型蒸馏、量化(INT8/INT4)、剪枝等常用模型压缩技术,有落地经验