岗位职责
- 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。
- 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板。
- 建设细粒度评测和错误分类体系,对模型失败案例进行聚类、归因和优先级判断。
- 研究难例挖掘、数据筛选、数据合成、拒绝采样、偏好构造和数据配比等策略。
- 建设视频生成偏好数据,包括 Pairwise Ranking、评分标准、标注规范及质量控制机制。
- 探索基于多模态模型、Reward Model 和自动评测器的数据生产与筛选方法,提升数据生产效率。
- 与模型团队共同开展 SFT、DPO、Reward Fine-tuning、RL 等实验,分析不同数据策略对模型能力的影响。
- 结合离线评测、人工反馈和实际使用反馈,形成“模型评测—数据归因—数据构造—训练验证”的后训练数据飞轮。
职位要求
- 2027 届以后本科或研究生在读,计算机、人工智能、数学、统计学等相关专业优先。
- 熟悉深度学习基础,了解多模态模型、视觉语言模型或视频生成模型的基本原理。
- 对数据内容及分布敏感,能够从数据现象中发现问题、提出假设并设计实验验证。
- 熟练使用 Python,掌握 PyTorch,具备良好的数据分析、统计和可视化能力。
- 了解 embedding、向量检索、聚类、分类、去重或采样等常用算法。
- 具备较强的研究能力和工程能力,能够独立定义问题并推动落地。
- 每周可实习 4 天及以上,连续实习 3 个月以上,能长期实习者优先。