招聘中 社招

大模型训推平台技术专家

招聘方暂未公开

  • 上海
  • 技术类

收录时间

岗位职责

围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地:

  1. 大规模预训练资源调度 设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额; 基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率; 拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销; 通信与存储 IO 路径优化,配合训练框架提升端到端通信效率
  2. 自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复 故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力
  3. 模型训推 DevOps 打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环。 镜像与产物治理:训练/推理基础镜像标准化,模型权重与 Checkpoint 版本化 registry,统一 artifacts 生命周期管理 CI/CD 与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B 流量切换 可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO 与告警闭环,故障注入与应急演练

职位要求

  1. 本科及以上,5 年以上 Infra / 平台工程经验,能独立负责一个技术方向的架构与落地
  2. 精通 Go 或 Python,深入理解 K8s 生态与 Operator 模式
  3. 理解分布式训练(DDP/Pipeline/MoE)或大模型推理 Serving 架构
  4. GPU 集群调度、训练框架、推理引擎至少其一有深度实战经验
  5. 熟悉 NCCL / IB / RDMA 等高性能网络 加分项
  6. 万卡级预训练平台或大规模推理平台 0→1 建设经验
  7. 拓扑感知调度、训练故障自愈、推理分离架构其一有落地经验
  8. 开源社区贡献(Megatron / Volcano / Ray / vLLM / SGLang 等)

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

招聘方暂未公开大模型训推平台技术专家

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看大模型训推平台技术专家正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位大模型训推平台技术专家招聘方暂未公开 · 上海

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏大模型训推平台技术专家正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

招聘方暂未公开大模型训推平台技术专家社招 · 上海

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入大模型训推平台技术专家内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。