招聘中 社招

达摩院-多模态大模型算法工程师(视频理解方向)-杭州

阿里集团

  • 杭州
  • 技术类-算法

收录时间

岗位职责

  1. 多模态大模型的视频理解应用:基于主流多模态大模型,通过微调、后训练与模型适配,解决视频内容理解、长视频结构化、视频问答、时序定位及复杂事件推理等问题,推动模型能力落地。
  2. 跨模态融合理解:融合音频(语音/音效/说话人)、文本(字幕、ASR 转写、OCR、元数据)等多源信息,设计跨模态对齐与融合方案,提升复杂场景下的理解效果与鲁棒性。
  3. 模型效率与部署成本优化:面向长视频推理成本问题,通过蒸馏、剪枝、量化、视觉 token 压缩及推理引擎优化降低资源开销,探索跨帧特征复用、Tracking 辅助推理等效率方案。
  4. 数据与评测体系:构建高质量多模态指令与评测数据(视觉-音频-文本对齐),搭建覆盖多任务的数据清洗、标注与评测 pipeline,支撑模型效果迭代。
  5. 技术前瞻与创新落地:持续跟踪 Video-LLM 与多模态大模型前沿进展,研判关键技术演进方向,推动前沿技术的引入、适配与创新,实现其在视频理解场景中的业务价值转化。

职位要求

  1. 计算机、人工智能、电子信息、数学等相关专业,硕士及以上学历,具备 3 年以上视频/多模态算法研发经验。
  2. 具备扎实的深度学习与计算机视觉基础,熟练使用 Python 与 PyTorch;理解多模态大模型原理,具有模型微调及 SFT、DPO/GRPO 等后训练实践,能用于解决视频理解问题。
  3. 具备完整的项目经验,能独立完成从需求分析、方案设计、算法研发到上线交付的全流程;具备较强的问题分析能力,能在效果、性能、开发成本与业务收益之间合理取舍。
  4. 具备良好的沟通协作能力,能与业务、产品及工程团队进行技术沟通和项目推进。 加分项
  5. 有音视频-文本跨模态融合、长视频/长上下文建模的研究或落地经验。
  6. 有较强工程与系统落地能力:对 TensorRT、ONNX Runtime、CUDA、算子优化、混合精度或端侧/资源受限部署有实际经验,或有大规模视频理解/搜索/处理系统、视频理解 Agent 的落地经验。
  7. 在 CVPR、ICCV、ECCV、ACM MM、NeurIPS、ICML、ICLR、TIP 等顶会或顶刊发表过论文,或在开源社区有较大影响力。
  8. 有独立负责技术方向、带领小型项目或指导初级算法工程师及实习生的经验。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团达摩院-多模态大模型算法工程师(视频理解方向)-杭州

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看达摩院-多模态大模型算法工程师(视频理解方向)-杭州正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位达摩院-多模态大模型算法工程师(视频理解方向)-杭州阿里集团 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏达摩院-多模态大模型算法工程师(视频理解方向)-杭州正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团达摩院-多模态大模型算法工程师(视频理解方向)-杭州社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入达摩院-多模态大模型算法工程师(视频理解方向)-杭州内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。