岗位职责
深入阿里云各行业客户的真实业务场景,基于多模态生成大模型如Wan、Qwen-Image、Z-Image等,攻克一致性与可控性难题,打造高效率、个性化的AI视觉内容供给模式,实现学术研究与商业产出的双重价值。 工作内容包括并不限于:
- 前沿技术攻关:聚焦生图模型领域,解决“角色/主体一致性”难题,攻克复杂的多轮生成、跨图一致性及风格迁移等技术难点;
- 算法优化与落地:提升模型在图像编辑任务(如局部重绘、背景替换、风格迁移)中的指令遵循能力,确保编辑区域精准变化的同时保持全局协调;
- 学术产出与创新: 在资深Mentor指导下进行技术研究,针对上述难点提出创新性解决方案,目标产出高质量顶会(CVPR/ICCV/ECCV等)论文及技术专利;
- 业务协同: 推动核心算法在电商、营销、设计、游戏、教育等实际业务场景的落地,直接参与提升模型商业化应用效果。
职位要求
- 硕士及以上学历,计算机、人工智能、模式识别、机器学习等相关专业,有扎实的理论基础和丰富的实践经验;
- 具备优秀的编码能力与数据结构基础,熟练掌握Python,有ACM-ICPC、NOI等算法竞赛奖牌者优先;
- 熟悉PyTorch等主流深度学习框架,熟悉分布式训练框架(如Pytorch2, DeepSpeed等),熟悉扩散模型(Diffusion Models)、Transformer等主流架构,有大模型微调(SFT)、RLHF/DPO或多模态大模型(如QwenVL/Stable Diffusion/FLUX等)相关项目经验者优先;
- 在CVPR, ICCV, ECCV, ICML, NeurIPS, ICLR等国际顶级会议发表过多模态/CV相关论文者优先;
- 具备极强的钻研精神和解决复杂问题的热情,逻辑清晰,沟通协作能力强。