岗位职责
- 构建面向文本、图片、音频、视频的多模态数据理解系统,包括 embedding、retrieval、clustering、classification、tagging 等能力;
- 分析海量数据分布、多样性、冗余、缺失及长尾问题,持续优化训练数据质量;
- 设计高效的数据去重、聚类、召回、采样和数据配比策略,服务于预训练、SFT、RL 等数据生产;
- 与模型团队共同完成数据实验,持续分析数据对模型能力的影响,形成自动化数据飞轮;
- 推动数据分析平台、可视化工具和自动化数据 Pipeline 建设,提高整体数据生产效率。
职位要求
- 2027届本科及以上学历,熟悉 Qwen-VL、Gemma、Gemini 等多模态模型。
- 有 PB 级数据处理经验(Spark/Ray/Flink 等)。
- 有训练数据分析、数据飞轮或推荐系统经验。
- 我们希望你对数据内容保持敏感,有能力从海量数据中发现规律,而不仅仅完成 Pipeline。
- 喜欢从数据出发解释模型问题,并主动推动实验验证。
- High Agency,能够独立发现问题、定义问题并推动落地。