招聘中 社招

【Dots】大模型数据工程

小红书

  • 北京市,上海市
  • 大模型

收录时间

岗位职责

  1. 负责 万亿级语料数据 处理体系的设计与优化,涵盖 数据采集、清洗、存储、转换、索引 及分析等全流程建设。
  2. 设计并优化 超大规模数据管道(ETL),提升网页数据的抽取、转换、加载(ETL) 效率,确保数据高效流转和存储。
  3. 负责 超大规模分布式数据处理架构 设计,支撑搜索引擎及大模型预训练数据处理需求。
  4. 研究并优化数据存储、索引及查询架构,提高 语料数据的组织方式,支持大规模 文本、结构化/非结构化数据 的高效检索。
  5. 研发 高效的数据清洗、去重、质量评估 体系,确保大模型训练数据的高质量输入。
  6. 与 算法、搜索、模型训练团队 深度合作,提升数据可用性,助力大模型预训练及微调。
  7. 关注高性能计算,优化数据处理任务的并发执行、计算资源管理,提升计算效率和存储利用率。

职位要求

-本科及以上学历,计算机科学、软件工程、大数据等相关专业,5 年以上大规模数据处理经验。 -精通大数据技术栈,包括但不限于: -计算框架:Hadoop、Spark、Flink、Ray 等,具备流批一体化数据处理经验。 -存储系统:HBase、ClickHouse、Cassandra、Elasticsearch、Iceberg、Delta Lake 等,能够根据业务需求选择最优存储方案。 -分布式消息队列:Kafka、Pulsar 等,优化大规模数据流传输。 -ETL 及数据管道:精通 Airflow、KubeFlow 等数据编排工具,能够高效构建数据流转任务。 -熟练掌握至少一种编程语言(Python、Java、Scala),具备良好的代码优化及系统调优能力。 -深入理解大数据架构设计,具备超大规模数据管道的架构设计与落地经验。 -具备高并发、高吞吐的数据处理经验,熟悉分布式系统一致性、任务调度、计算优化等技术。 -熟悉 大规模网页数据处理,具备 海量非结构化数据的解析、索引优化 经验。 -具备高性能计算和存储优化能力,熟悉数据分片、索引优化、分布式查询加速等技术。 加分项 具备 PB 级别数据处理经验,熟悉 数据湖(Lakehouse)架构 设计,如 Iceberg、Delta Lake 等。 有 大模型语料处理经验,熟悉数据清洗、去重、格式标准化、质量评估等关键环节。 有 搜索引擎、推荐系统、知识图谱 相关数据处理经验者优先。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

小红书【Dots】大模型数据工程

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看【Dots】大模型数据工程正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位【Dots】大模型数据工程小红书 · 北京市,上海市

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏【Dots】大模型数据工程正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

小红书【Dots】大模型数据工程社招 · 北京市,上海市

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入【Dots】大模型数据工程内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。