招聘中 社招

Token Foundry-大模型训练Infra工程师-训练稳定性方向

通义实验室

  • 北京、杭州
  • 技术类-开发

收录时间

岗位职责

  1. 建设超大规模训练的稳定性治理体系,围绕有效训练时长(ETTR)与 Goodput 做端到端度量与优化,量化并持续压缩因故障、回滚、启动带来的无效算力(Badput)。
  2. 构建覆盖软硬件异常的故障可观测能力,完善日志、指标、事件的采集与关联分析;研发智能诊断能力,实现训练 slow / hang / OOM / 通信异常等故障的快速定界与根因追溯,沉淀故障模式库与自动诊断规则。
  3. 研发自动容错与快速恢复机制,支持断点续训、Pod 级快速重启、节点自动自愈、动态降级与局部重试;优化 failover、本地盘 / 缓存与 Checkpoint 恢复链路,缩短故障恢复时延。
  4. 建设节点健康度评估与主动巡检体系,覆盖 GPU、网络、存储等软硬件健康,实现故障节点的快速隔离与自愈;支持 Ray 等分布式框架下的作业级故障感知与处理。
  5. 与算法及框架团队协同保障训练全生命周期稳定交付,沉淀可复用的稳定性平台能力,推动变更灰度与自动化运维。

职位要求

  1. 计算机、电子、自动化等相关专业本科及以上学历,2 年以上分布式系统或大规模基础设施研发经验。
  2. 扎实的分布式系统与 Linux 基础,熟悉常用性能与故障诊断工具(nvidia-smi、nsight、perf、py-spy、gdb、strace 等),有较强的疑难问题定位能力。
  3. 具备以下至少一个方向的深度实践经验: a. 大规模分布式作业的容错与自愈系统(故障检测、断点续训、快速重启、failover、Checkpoint 恢复优化,类比 DLRover 等开源项目); b. 大规模系统可观测与智能诊断(日志 / 指标 / 事件关联分析、根因定位、异常检测); c. 节点健康度评估、硬件故障诊断或 SRE / 稳定性工程体系建设。
  4. 了解大模型训练 / RL 的基本流程与常见故障模式(slow、hang、OOM、NCCL 通信异常等),了解 PyTorch、Ray 等框架的运行机制;具备良好的问题抽象与系统设计能力。
  5. 良好的工程素养与跨团队协作能力,能在高强度、快迭代的大模型训练场景中稳定交付。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

通义实验室Token Foundry-大模型训练Infra工程师-训练稳定性方向

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看Token Foundry-大模型训练Infra工程师-训练稳定性方向正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位Token Foundry-大模型训练Infra工程师-训练稳定性方向通义实验室 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏Token Foundry-大模型训练Infra工程师-训练稳定性方向正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

通义实验室Token Foundry-大模型训练Infra工程师-训练稳定性方向社招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入Token Foundry-大模型训练Infra工程师-训练稳定性方向内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。