招聘中 社招

大模型训练工程师(LLM Training Engineer)

快手

  • 北京、上海、深圳、杭州
  • 工程类

收录时间

岗位职责

  1. 负责大模型训练框架与训练平台的研发与演进,支撑万亿级参数模型训练落地;
  2. 负责分布式训练方案设计与优化(DP/TP/PP/ZeRO/FSDP/MoE 等),提升吞吐与资源利用率;
  3. 负责训练性能调优,包括算子优化、混合精度(BF16/FP16/FP8)、显存优化、通信优化与 pipeline overlap;
  4. 负责训练稳定性建设,包括容错恢复、监控告警、性能回归、训练诊断与自动化运维能力;
  5. 参与强化学习训练框架与对齐训练流程建设,支持 RLHF/PPO/DPO/GRPO 等训练任务的工程优化与平台化落地;
  6. 跟进前沿训练系统技术,推动在业务场景规模化落地。

职位要求

  1. 本科及以上学历,计算机/软件/电子相关专业;
  2. 熟练掌握 Python/C++,具备扎实的工程能力与系统调试能力;
  3. 熟悉 PyTorch 训练机制,理解反向传播、梯度同步、显存管理等原理;
  4. 熟悉分布式训练框架(Megatron-LM/DeepSpeed/FSDP 等)并具备实战经验;
  5. 熟悉 GPU/NPU 性能优化方法,能独立完成 profiling 与瓶颈定位(Nsight/perf 等);
  6. 熟悉训练侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel 开发、编译器优化等;
  7. 了解强化学习训练基本流程与常见框架,熟悉 rollout、reward model、policy update 等机制者优先;
  8. 具备良好的问题分析能力与跨团队协作能力。 加分项:
  9. 有 MoE/长序列/多机多卡大规模训练经验;
  10. 熟悉 NCCL/HCCL/RDMA/IB 通信优化;
  11. 有量化训练、低比特训练或 QAT(Quantization-Aware Training)相关实践经验;
  12. 有国产卡适配与性能优化经验(昇腾/寒武纪/沐曦等);
  13. 有开源贡献或高性能系统相关论文/专利。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

快手大模型训练工程师(LLM Training Engineer)

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看大模型训练工程师(LLM Training Engineer)正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位大模型训练工程师(LLM Training Engineer)快手 · 北京、上海、深圳、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏大模型训练工程师(LLM Training Engineer)正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

快手大模型训练工程师(LLM Training Engineer)社招 · 北京、上海、深圳、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入大模型训练工程师(LLM Training Engineer)内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。