岗位职责
课题背景 研发面向多模态理解(VLM)、图像生成、视频生成、语言理解和生成、3D大模型的通用压缩加速算法,通过量化、稀疏化、投机解码、步数蒸馏、流式生成、Sparse-Attn/KV-Cache压缩、Token/模型剪枝、动态分辨率等算法创新,在保持模型效果无损的前提下,配合推理框架团队完成加速部署落地,持续降低多模态大模型在音频、3D、图像、视频的理解和生成、视觉多轮交互等任务的部署成本。 课题挑战
- 多模态理解与生成量化稀疏化:探索自回归、Diffusion、ViT、VAE等架构更低bit量化/稀疏化算法(含通信量化),针对3D、音频、图像、视频等多种模态数据及模型特性,设计量化/稀疏算法,并推进推理框架适配落地;
- 多模态生成蒸馏:针对3D、音频、图像、视频生成模型,设计步数蒸馏、流式生成蒸馏算法等技术,降低端到端生成延迟,实现实时交互体验
- 多模态长序列性能优化:针对长视频理解与生成、实时语音交互等长上下文场景,研究视觉/音频理解Token剪枝及投机采样、图像视频动态分辨率生成、DiT/自回归模型的稀疏注意力、KV-Cache压缩等SOTA算法。解决多模态Token序列过长导致的显存爆炸和计算瓶颈问题。 具体工作 通过量化、投机解码、步数蒸馏、流式生成、Sparse-Attn/KV-Cache压缩、Token/模型剪枝、稀疏化等模型压缩方法,保证多种模态的理解和生成效果的同时,大幅降低模型耗时、提升吞吐,提升用户体验优化推理成本
职位要求
- 包含但不限于计算机科学、人工智能、电子工程、自动化等相关专业。具备扎实的机器学习/深度学习基础;
- 精通Python编程,熟练掌握PyTorch等深度学习框架。对Transformer、Diffusion等模型架构、计算瓶颈与优化方法论有深刻理解;具备以下至少一个领域经验:图像视频生成、音频理解生成、图像视频编辑/理解、模型压缩(步数蒸馏,轻量化模型,投机解码、KVCache优化、稀疏剪枝等)、生成对齐算法(DPO\RLHF等)。
- 满足上述课题方向中任意一个即可