岗位职责
岗位描述面向真实业务场景,围绕图像、视频、语音、文档等多模态内容的理解与生成,开展算法研发与能力落地。你将参与多模态理解、跨模态推理、内容生成与 AIGC 应用优化,推动相关能力在搜索推荐、内容创作、交互体验、智能体等场景中的持续迭代,提升模型效果、用户体验和业务价值。 具体职责:
- 围绕图像、视频、语音、文档等多模态内容,开展理解、生成、编辑与交互相关算法研发,提升模型在真实场景中的效果与可用性;
- 探索并优化多模态理解、跨模态对齐、视觉问答、文档理解、视频理解、图文检索、内容生成与编辑等关键能力;
- 结合大模型、AIGC、多模态学习与 Agent 技术,推动多模态能力在业务场景中的落地,包括内容生产、智能审核、交互式生成、创意优化等方向;
- 建设多模态数据与评测体系,覆盖数据采集、清洗、对齐、标注、增强、难例挖掘与效果分析,持续优化模型训练与迭代效率;
- 参与线上实验与效果分析,结合业务目标持续优化模型表现、生成质量、稳定性与成本效率。
职位要求
- 计算机、人工智能、数学、电子信息等相关专业优先;
- 熟悉计算机视觉、多模态学习及深度学习基础,理解图像/视频理解、跨模态建模、内容生成与表征学习等核心方法;
- 了解 Transformer、VLM、Diffusion 等主流架构,有多模态训练、生成模型或相关项目经验者优先;
- 具备较强的数据处理、实验设计、效果分析与问题定位能力,能够独立推动算法方案迭代;
- 熟练掌握 Python 与 PyTorch,具备良好的算法实现与工程落地能力;
- 有多模态项目、竞赛、论文复现或实际业务落地经验者优先。 加分项:
- 有图像/视频生成、AIGC、可控生成、交互式编辑等方向实践经验;
- 有多模态搜索、视觉问答、OCR/文档理解、视频理解等落地经验;
- 有顶会论文、开源贡献、竞赛奖项或高质量项目成果。