岗位职责
- 多模态大模型应用研发:基于多模态大模型(MLLM)强大的世界知识与推理能力,研发复杂场景下的主体识别算法,精准定位视频/图文中的核心主体(如开箱商品、主推款),解决遮挡、多实例干扰等难题。
- 细粒度语义对齐与表征学习: 构建统一的多模态表征空间,负责封面、视频、商品图文之间的细粒度语义对齐,提升跨模态检索与粗筛的召回率。
- 判别模型设计: 设计具备“Thinking with Images”能力的判别式大模型,实现对“挂错品”、“封面党”等高阶语义偏差的精细化验证,并探索模型的可解释性(输出决策依据)。
- 模型蒸馏与落地: 参与大模型到轻量化小模型的知识蒸馏(Model Distillation)工作,设计表征-判别联合蒸馏框架,在保障算法精度的同时满足线上业务的高吞吐与低延时需求。
- 前沿技术探索: 跟踪CV、NLP及多模态领域的SOTA技术,结合业务场景进行创新,有机会将成果发表在CVPR、ICCV、ECCV等顶级会议上。
职位要求
- 计算机、人工智能、数学等相关专业在读硕士或博士。
- 扎实的机器学习与深度学习理论基础,熟练掌握Python,精通PyTorch等主流框架。
- 有多模态领域、大模型等领域有相关实践者优先。
- 在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议发表过相关论文者优先。
- 能够连续实习3个月以上,具备良好的逻辑思维能力和沟通协作能力,对技术挑战充满热情,有复杂问题的解决能力。