岗位职责
- 探索视频多模态大模型的前沿技术,负责数据建设、模型训练与评测框架搭建。
- 深入研究并实践视频多模态大模型的全套训练流程,包括pretraining、mid-training、SFT、RL、on-policy distillation等。
- 跟踪并复现主流的开源视频多模态模型,进行前沿论文的调研、复现与创新。
- 协助优化视频内容理解、dense video caption、视频生成/编辑中的用户意图理解等相关任务上的模型效果,持续提高算法的性能与效率。
职位要求
- 具备多模态大模型的相关知识,熟悉VLM、video VLM以及长视频内容理解,了解主流的开源模型。
- 熟悉VLM、video VLM的预训练、中训练、后训练等关键流程,具备数据处理、模型训练与评测的实践经验。
- 有大模型训练框架,如DeepSpeed、Megatron、Verl、Swift等的使用经验。
- 关注技术前沿,具备优秀的学习能力和自我驱动力。