招聘中 校招

AI数据与检索基础设施工程

蚂蚁集团

  • 北京、上海、杭州
  • 技术类

收录时间

岗位职责

负责建设面向 AGI 的核心数据与检索引擎,支撑全域大模型的训练及 Agent 应用闭环。 具体的职责包括以下相关方向的一项或多项:

  1. 高密度语料熔炉与预训练基建。建设面向海量多模态数据的极速流水线。研发高效和高准入门槛的分布式去重、质量打分与退火期数据动态配比调度统。通过提升预训练数据的纯度与信息熵,直接为底座模型节省海量 GPU 算力,拉升模型的基础逻辑推理天花板;
  2. 数据合成与后训练飞轮。结合强模型蒸馏与大模型评测,构建自动化的 SFT 与 RLHF 数据合成与清洗流水线。打造从真实线上 Agent 复杂轨迹捕获、清洗到模型自动微调对齐的数据反馈飞轮,实现模型能力的高效自我进化;
  3. 认知记忆与智能检索基建。建设高吞吐的向量/图数据库索引。探索并落地结构化知识图谱与大模型底层的深度融合,根除模型多跳推理幻觉。研发支持亿级用户的 Agent 长周期记忆系统,实现对话上下文的高能压缩与合规流转,提升个性化推理效果。

职位要求

  1. 扎实的工程底色: 计算机、数学或相关专业应届毕业生。精通Python,并熟练掌握C++、Java,Go或Rust中的至少一种语言。对数据结构、算法及高并发系统设计有深刻理解;
  2. 熟练的大数据技能:熟悉分布式计算与存储原理。了解 Spark、Flink 等传统框架,同时对 Ray 等面向 AI 计算调度的现代分布式框架有强烈的探索欲或实践经验;
  3. 核心的 AI Native 思维: 不仅将数据视为报表或资产,更将其视为模型的表征与燃料。理解Transformer底层原理,熟悉Tokenization、Embedding机制,深刻认知数据分布、多样性及噪声对生成式AI效果的决定性影响;
  4. 敏锐的技术视野:关注开源 AI 社区,了解 LangChain、LlamaIndex 或各类主流向量/图数据库。对 GPU 显存机制、推理延迟(TTFT)或 Token 成本有基本概念者佳。 加分项(非必须但高度优先):
  5. 有在核心搜索、推荐系统或商业化广告引擎的数据架构实习经验;
  6. 曾亲自动手微调过开源大模型,或深度参与过高质量Instruction-tuning数据集的构建与清洗;
  7. 在顶会(如 KDD, ACL, NeurIPS, OSDI, SOSP)发表过数据挖掘、NLP 或分布式系统相关论文;
  8. 活跃的开源贡献者,曾向 vLLM, Ray, Megatron-LM 等知名 AI Infra 项目提交过 PR。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

蚂蚁集团AI数据与检索基础设施工程

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看AI数据与检索基础设施工程正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位AI数据与检索基础设施工程蚂蚁集团 · 北京、上海、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏AI数据与检索基础设施工程正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

蚂蚁集团AI数据与检索基础设施工程校招 · 北京、上海、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入AI数据与检索基础设施工程内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。