岗位职责
- 负责多模态内容理解、多模态生成等算法技术在视频剪辑、多模态理解和生成业务上的落地工作:;
- 图像、视频、语音等多模态内容理解和生成算法的模型设计、训练、优化;
- 文生图、文生视频、图生视频等算法的探索和落地;
- 实现模型轻量化(知识蒸馏、量化剪枝)及推理加速,满足低延迟需求;
- 跟踪多模态大模型、世界模型等前沿方向,探索业务结合点。
职位要求
- 具备深厚的图像、视频、语音、NLP等领域算法基础,具备独立探索前沿方向技术的能力;
- 具备良好的分析和解决问题的能力,针对具体的应用场景,能合理设计和优化算法并应用;
- 熟悉pytorch或tensorflow,具备较好的数据处理能力;
- 具备良好多模态理论和算法基础者优先;
- 沟通能力良好,工作认真负责。