岗位职责
Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立以来,先后发布了Qwen-Image、Qwen-Image-Edit、Qwen-Image-
- 0等一系列业界领先的文生图与图像编辑基座大模型。团队正在打造全球领先的视觉生成技术体系,推动AI在企业服务、开发者生态及个人内容创作等领域的深度应用。我们专注于研发前沿视觉生成技术,充分探索数据与训练方法,旨在解决计算机视觉基本问题的同时,为AI赋予真正的创造力。 作为RL算法实习生,你将深度参与视觉生成大模型的后训练(Post-training)与人类偏好对齐工作,具体职责包括:
- Reward Model(奖励模型)研发:负责高质量奖励模型的设计与训练,探索基于VLM的复合奖励信号(如逐点评分、思维链推理等),提升模型在图文一致性、美学质感、指令遵循及人脸身份一致性等维度的判别精度与泛化性能。
- RL对齐算法优化:深入研究并落地主流强化学习及偏好对齐算法(如GRPO、RLHF等),优化图像生成与编辑任务的RL策略迭代,解决Reward Hacking问题,提升模型在复杂任务中的表现与稳定性。
- 多任务统一与策略蒸馏:探索面向多任务(如文生图与图像编辑)的联合训练与优化方案,参与在线策略蒸馏(OPD)等前沿技术的研发,将多任务教师模型合并为统一的生成模型,在不牺牲各任务质量的前提下实现能力统一。
- 偏好数据体系建设:与数据团队紧密合作,构建和优化人类偏好数据(Preference Data)流程,设计高效的数据采样与质量控制策略,探索利用强模型辅助生成高质量偏好数据(RLAIF),通过数据飞轮驱动模型效果提升。
- 前沿技术跟踪与落地:持续跟踪视觉生成与强化学习交叉领域的最新研究进展,结合Qwen-Image业务场景探索新的算法优化方向,撰写高质量技术报告,保持团队在该领域的技术领先性。
职位要求
- 计算机、数学、人工智能等相关专业硕士/博士在读,每周可实习5天,持续实习6个月及以上。
- 具备扎实的计算机视觉、深度学习与强化学习基础知识,深入理解强化学习基本原理,熟悉PPO、GRPO等大模型主流对齐算法。
- 有视觉生成模型(扩散模型/流匹配模型)或大语言模型后训练(SFT -> RM -> RL)完整流程实战经验者优先。
- 熟练掌握Python编程语言与PyTorch等主流深度学习框架,具备优秀的代码实现能力与大规模模型训练调优经验。
- 自我驱动力强,对AI行业有浓厚兴趣,具备出色的问题分析与解决能力,能够独立定位RL训练中的不稳定性与收敛问题。
- 具有良好的沟通协作能力与Owner意识,能够与数据、工程及产品团队紧密配合,推动算法从验证到业务上线。 加分项:
- 在计算机视觉或AI领域顶级会议/期刊(如CVPR, ICCV, ECCV, NeurIPS, ICML, ICLR等)上有强化学习、大模型对齐或视觉生成相关的高质量论文发表。
- 在知名开源社区(如GitHub)发布过有影响力的视觉生成或RL相关项目,或对主流开源项目有核心贡献。
- 具备ACM/ICPC/NOIP等算法竞赛获奖经历,或在相关AI竞赛中获得引领性研究成果。
- 熟悉VERL等主流大模型训练框架,具备分布式训练和显存优化经验者优先。