部门介绍
AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。
- 负责多模态模型在商业化广告场景下的训练数据建设与模型评测,涵盖SFT、RL、偏好数据及专项能力数据的生产迭代,结合业务场景设计数据与评估方案(数据挖掘、构造、清洗去重、标注规范、质量验收、评估集建设),分析数据分布、覆盖度、多样性及质量问题,识别数据偏差与能力缺口,持续优化数据配比与生产策略;
- 基于模型调用链路、检索结果、工具调用及回复等信息开展负面案例分析与根因定位,判断问题来源于数据、模型、策略或工程链路,结合实验结果验证数据有效性,推动训练数据持续迭代,设计并完善数据生产与模型评测的自动化流程,提升整体效率;
- 能够统筹跨部门资源,推动数据团队和算法、产品团队的深度融合,共同制定并明确数据规范与交付标准,确保项目目标高质量达成;
- 通过技术分享和实践指导,提升数据团队对AI应用、模型及前沿技术的理解和应用能力,推动数据能力、评估标准和自动化工具复用,推动团队达成业务目标。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 2027届获得本科及以上学历,计算机/AI/软件工程/人工智能/数据科学等相关专业优先;
- 其他专业如果做过AI大模型训练和评测方面相关的也可,熟悉Python等编程语言加分,在多模态领域的PE、Workflow、Agent等技术的使用上有落地成果,理解大模型基础原理(如Transformer架构、SFT/RLHF训练范式),持续追踪AIGC前沿进展,具备数据清洗、数据分析、数据预处理或自动化脚本开发经验;
- 大模型训练和评测以及自动化等领域相关实习或项目经验(做过商业化广告领域的图片和视频多模态模型经验加分),熟悉数据生产全流程,对大模型训练、评测或应用领域、各项AI工具有浓厚兴趣和热情,持续关注前沿研究与技术趋势,具备快速学习与探索能力;
- 具备较强的自驱力和学习能力,思路清晰,逻辑性强,具备跨团队协作与沟通能力,能够在复杂项目环境中独立推进工作。