岗位职责
大数据工程部定位于为基座模型及业务提供高质量数据与 AI 化解决方案。我们以数据为核心,通过数据工程与模型算法相结合的方式,加速大模型在数据、实验与评测环节的迭代效率,持续沉淀高价值数据资产,支撑模型与应用的演进。在具体实践中,我们面向多语言、多模态大模型训练,开展数据清洗、去重、打标等关键算法与方法建设,并系统性构建预训练与后训练数据管道,从质量、覆盖度与多样性等维度提升数据整体水平,持续助力模型效果提升。同时,我们积极探索合成数据、数据规模扩展规律、多模态数据对齐等前沿数据方向,将数据侧的创新转化为可验证、可复用的模型收益。
- 负责多语言、多模态大模型训练所需的数据清洗、质检、去重、理解等算法开发,通过构建完整的数据体系,为大模型的训练数据质量负责;
- 负责大模型预训练数据管道建设系统性方法研究,通过质量/覆盖/多样性等方法构建高质量预训练、后训练数据,提升基座模型训练效果;
- 探索前沿数据方案,包括不限于合成数据、数据扩展规模定律、多模态数据对齐等基础AI问题,推动数据驱动AI的性能突破;
- 不断跟进业界前沿数据算法,提高数据算法效果和效率,持续提升模型训练效果
职位要求
- 本科及以上学历,计算机、人工智能、自动化、机器人等相关专业;
- 具备扎实的机器学习/深度学习基础,对大模型训练或应用有实际经验;
- 能够将业务问题拆解为数据问题 + 模型问题,并形成可执行方案;
- 具备良好的跨团队协作能力,能与业务、算法、工程多角色协同推进项目。
- 致力于构建高质量预训练数据体系,以支持模型效果持续提升为长期目标,坚持高标准交付与持续优化;
- 符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信。