已下线 社招

大模型预训练工程师-AI Data

字节跳动

  • 北京
  • 研发

收录时间

已下线 · 历史岗位确认下线时间:。以下为收录时的信息,不代表当前仍可申请。查看历史岗位档案

岗位职责

  1. 主导大模型数据生产的Pipeline建设,涵盖寻源、采集、解析、处理、实验与分析等环节,为各基础模型提供稳定、大规模且高质量的预训练数据;
  2. 负责前沿数据合成研究,探索基于LLM的数据合成与增强技术(如Self-Instruct、Agent交互模拟等),设计高效生成策略以补充数据缺口;
  3. 建立针对合成数据的自动化评估体系(如Reward Model、LLM-as-a-Judge),并结合模型评测与数据分析反馈,反向迭代生产线与数据生成策略;
  4. 搭建并优化大模型预训练的数据工程底座,开发自动化框架与平台,支持海量数据的清洗、去重与格式化处理,提升底层资源调度与数据策略迭代效率;
  5. 沉淀全网高质量预训练数据,建设端到端的数据质量、多样性体系及场景化标签,与算法及基建团队高效协同,探索真实与合成数据的最优配比。

职位要求

  1. 本科及以上学历,计算机、人工智能、数学或相关专业,具备扎实的编程基础,精通Python,并掌握至少一种编程语言(Java/Go/C++);
  2. 具备AI数据开发经验,掌握大模型预训练基本原理,熟悉至少一类核心场景(代码生成或通用NLP)的数据特性;
  3. 在数据合成或基础工程方面,需具备以下任一方向的专业能力;研究方向:深入理解主流大模型架构及训练机制,熟悉各类Prompt技巧及数据增强机制,对大模型对齐(RLHF/DPO等)背后的数据构建逻辑有深入研究;工程方向:熟悉Spark、Flink、Ray等分布式计算框架,具备海量数据全流程清洗与处理经验,熟悉vLLM等推理加速框架者优先;
  4. 具备数据质量指标设计能力,能够熟练使用机器学习算法优化数据筛选与评估效率,沟通高效,能精准对接需求并协调资源。 加分项
  5. 参与过大模型数据准备,或有合成数据训练大模型成功落地经验者优先;
  6. 在自然语言处理或大模型相关领域(ACL、EMNLP、NeurIPS等)发表过高水平论文,或在GitHub开源项目(特别涉及合成数据、数据处理)有活跃贡献者优先。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动大模型预训练工程师-AI Data

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看大模型预训练工程师-AI Data正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏历史岗位,保留参考信息

当前岗位大模型预训练工程师-AI Data字节跳动 · 北京

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏历史岗位此岗位已经下线,收藏仅用于保存历史参考。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码查看并收藏历史岗位,不代表当前仍可申请。

微信扫码在职先机小程序收藏大模型预训练工程师-AI Data正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动大模型预训练工程师-AI Data社招 · 北京

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入大模型预训练工程师-AI Data内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。