岗位职责
- 分析大规模视频、图像及文本数据的内容分布、质量、多样性、冗余度、长尾覆盖和缺失模式。
- 建设多模态数据理解能力,包括 embedding、检索、聚类、分类、标签体系、Caption 和质量评估。
- 研究并落地数据清洗、去重、召回、采样、数据配比和课程学习等策略,优化预训练数据组成。
- 围绕人物、场景、动作、运镜、时序一致性、物理规律和审美等维度,建立视频数据分析与分层方法。
- 与模型团队共同设计数据消融和对比实验,分析数据规模、质量及分布对模型能力的影响。
- 持续识别预训练数据中的能力缺口,形成“数据分析—策略设计—训练实验—效果归因”的数据飞轮。
- 参与大规模数据处理 Pipeline、数据分析平台和可视化工具建设,提高数据研究及生产效率。
职位要求
- 2027 届以后本科或研究生在读,计算机、人工智能、数学、统计学等相关专业优先。
- 熟悉深度学习基础,了解多模态模型、视觉语言模型或视频生成模型的基本原理。
- 对数据内容及分布敏感,能够从数据现象中发现问题、提出假设并设计实验验证。
- 熟练使用 Python,掌握 PyTorch,具备良好的数据分析、统计和可视化能力。
- 了解 embedding、向量检索、聚类、分类、去重或采样等常用算法。
- 具备较强的研究能力和工程能力,能够独立定义问题并推动落地。
- 每周可实习 4 天及以上,连续实习 3 个月以上,能长期实习者优先。