招聘中 社招

阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work

阿里集团

  • 杭州
  • 技术类-算法

收录时间

岗位职责

  1. 支撑模型团队使用 Megatron 进行大规模分布式训练,处理 tensor parallel、pipeline parallel、data parallel、expert parallel、sequence/context parallel 等并行策略相关问题;
  2. 支撑模型团队使用 SGLang 进行高吞吐推理和 rollout,优化 batching、KV cache、prefill/decode 调度、长上下文稳定性和在线训练链路;
  3. 设计和实现面向更大模型规模的 post-training infra,降低训练资源成本,提高实验迭代效率和系统稳定性;
  4. 建设 profiling、benchmark、monitoring 和 debugging 工具,提升训练吞吐、GPU utilization、rollout 稳定性和故障定位效率;
  5. 与研究员和模型工程师紧密合作,把新的训练想法快速落地成可复现、可扩展、可长期维护的系统能力。

职位要求

  1. 扎实的工程能力,熟悉 Python,最好熟悉一种系统语言或高性能计算相关语言,例如 C++、CUDA、Rust 或 Go;
  2. 熟悉 PyTorch 生态,理解大模型训练的基本流程,包括 forward/backward、optimizer、checkpoint、activation checkpointing、mixed precision 等;
  3. 有分布式系统或大规模训练经验,理解 GPU 集群、NCCL、通信开销、显存瓶颈、吞吐优化和故障恢复;
  4. 对 Megatron、DeepSpeed、FSDP、SGLang、vLLM、TensorRT-LLM、Ray 等训练或推理系统中的至少一类有实际使用或开发经验;
  5. 理解大模型 post-training 的基本范式,例如 SFT、DPO、PPO、GRPO、RLHF、RLAIF 或 agentic RL;
  6. 能够在复杂系统中定位问题:从日志、metric、profile、checkpoint、到分布式 rank 行为,都愿意追到根因;
  7. 有强 ownership,能把一次性的实验脚本沉淀成可复用的工具、模板、文档和稳定接口;
  8. 能和研究团队高效协作,既尊重研究速度,也重视系统正确性和长期可维护性。 加分项:做过 LLM training infra、RLHF infra、online RL、agent training、tool-use training、MoE 训练、低精度训练/推理、PEFT 或高质量开源 infra 项目。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里集团阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work阿里集团 · 杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里集团阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work社招 · 杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。