部门介绍
Qwen-Image(千问图像)团队是阿里巴巴ATH事业群-Token Foundry下的图像生成基座团队,自2025年初成立以来,先后发布了Qwen-Image、Qwen-Image-Edit、Qwen-Image-
- 0等一系列业界领先的文生图与图像编辑基座大模型。团队正在打造全球领先的视觉生成技术体系,推动AI在企业服务、开发者生态及个人内容创作等领域的深度应用。我们专注于研发前沿视觉生成技术,充分探索数据与训练方法,旨在解决计算机视觉基本问题的同时,为AI赋予真正的创造力。 作为数据算法实习生,你将深度参与视觉生成大模型的数据全链路建设,用高质量数据驱动模型能力跃升,具体职责包括:
- 数据处理链路构建:深入理解视觉生成大模型的训练目标,设计并实现可靠、可扩展的数据处理流水线。实现海量多模态数据(图像、文本、视频等)的预处理、过滤、检索归类与规模化产出,支撑模型高效迭代。
- 智能清洗与质量评估:利用开源模型对原始数据进行智能清洗、质量打分与标注,探索自动化数据筛选策略,持续提升训练数据的规模与质量。
- 人工标注体系设计:与模型训练及评测团队密切合作,设计详细、可用的人工标注体系与规范。结合模型辅助,提高数据质量和可用性,为模型不同训练阶段提供高质量的数据支持。
- 数据与模型协同优化:针对模型训练中暴露的数据问题(如噪声、偏差、模态对齐缺失等)设计工程化解决方案,探索数据与模型协同优化的新方法,你处理的数据将直接进入生成模型的训练。
- 模型评测体系构建:协助建立专业且详尽的视觉生成大模型生成质量评估方法和基准测试,通过数据实验分析定位模型瓶颈,指引算法优化方向,建立“评测—分析—优化—复评”的迭代闭环。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机、数学、人工智能等相关专业硕士/博士在读,每周可实习5天,持续实习6个月及以上。
- 具备扎实的计算机视觉与深度学习基础,熟练掌握Python编程语言与PyTorch等主流深度学习框架,具备优秀的代码实现与工程能力。
- 对多模态数据处理有浓厚兴趣,熟悉图像、文本、视频等多模态数据的清洗、筛选、对齐与质量控制流程。
- 自我驱动力强,动手能力强,工作细致,具备出色的问题分析与解决能力,能够独立开发高效的数据处理算子与流水线。
- 善于平衡研究目标与落地实现,具备跨学科视野与协作意识,能够与算法、工程、产品等多学科团队紧密合作,推动研究成果快速落地。
- 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,敢于挑战现有范式,能够独立应用技术解决复杂问题。 加分项:
- 在计算机视觉或AI领域顶级会议/期刊(如CVPR, ICCV, ECCV, NeurIPS, ICML, ICLR等)上有视觉生成、多模态学习或数据处理相关的高质量论文发表。
- 在知名开源社区(如GitHub)发布过有影响力的数据处理、视觉生成相关项目,或对HuggingFace等主流开源生态有核心贡献。
- 熟悉FFmpeg、OpenCV、WebDataset/tar格式数据集,或具备分布式数据处理(如Ray/多进程)实战经验。
- 熟悉Code Agent工具,或有大规模数据实战经验、在相关AI竞赛中获得引领性研究成果。