岗位职责
- 大规模视频理解:负责可灵海量视频数据的打标分类、语义分割、文字识别、Caption生成、聚类分析等工作;
- 模型开发与优化:基于CNN、VLM等技术推进模型训练、微调、评测及高效部署,推动模型在实际场景中的大规模应用;
- 技术研究与创新:聚焦多模态视频生成领域前沿课题,探索生成模型的数据采样技术,提升生成模型的数据使用效率和语义响应能力,打造在业界的领先技术优势;
- 跨领域协作:参与跨团队跨部门技术协同,推动Human in the loop在视频生成领域的研究落地。
职位要求
- 学历与经验:硕士及以上学历,3年及以上相关工作经验。计算机视觉、自然语言处理或多模态方向背景优先;
- 学术背景:具备较强的学术调研能力,能快速理解和实现论文中的算法;有高质量论文发表、开源项目贡献、ACM竞赛或相关学术比赛获奖经历者优先;
- 深度学习能力:熟练掌握深度学习框架(如PyTorch、TensorFlow),有模型训练、压缩、蒸馏和微调经验;熟悉DeepSpeed等加速工具优先;
- 工程能力:具备优秀的独立开发与调试能力,熟悉Python服务开发,Hive大数据处理等技术;
- 团队协作:具备良好的沟通能力,乐于学习与分享,能够与团队高效协作解决问题。 【加分项】
- 熟悉视频处理相关工具与技术,如FFmpeg、OpenCV等;
- 在视频理解、多模态建模方向有实战项目经验。