招聘中 校招

【2027校招】大模型 Infra 工程师

小红书

  • 北京市,上海市,杭州市

收录时间

部门介绍

我们是小红书大模型基建部(RAI Studio),负责公司级 AI 大模型全链路基础设施建设。我们围绕「算力 - 框架 - 平台」三层体系,提供从大模型训练、压缩、部署、在离线服务到Agent构建发布的标准化能力,以解决大模型生产及应用过程中的效率、成本、稳定性和规模化交付问题。我们构建了 Relax RL 开源训练框架、RedSlim 模型压缩工具、rLLM 推理部署框架、以及大模型训练、部署、MaaS、Agent等平台设施,持续支撑社区、大商业、国际化、审核、企业智能等小红书核心业务的大模型落地。在这里,你会面对千卡级后训练、高并发推理、EPD 分离与 KV Cache 复用、低比特模型量化、国产异构芯片性能优化、万卡级 GPU 调度等真实业务的大规模 AI Infra 挑战。在这里你可以选择在训练、推理或模型压缩方向深耕,也可以参与跨方向系统设计,成长为真正理解大模型全链路的 AI Infra 工程师。团队持续参与开源与行业技术交流,期待有志于构建生产级 Infra 能力并持续提升个人行业影响力的优秀同学加入。

岗位职责

  1. 训练与推理框架研发: 参与 Relax RL 后训练框架和 rLLM 推理框架的核心研发,支撑 LLM、MLLM、Agent、DiT 等模型的高效训练与高性能在线推理;可根据个人专长重点负责训练、推理或模型压缩方向。
  2. RL Pipeline 与分布式训练优化: 支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,并结合 TP / PP / DP / ZeRO / Sequence Parallel 等并行策略提升端到端训练吞吐。
  3. 分布式推理与服务架构建设: 建设 KV Router、PD 分离 / EPD 分离、KV Cache 管理、Prefix Cache 复用、Continuous Batching、动态请求调度等核心能力,持续提升 TTFT、TPOT、吞吐、并发能力和 GPU 利用率。
  4. 模型压缩与加速算法探索: 探索并落地低比特量化、蒸馏、剪枝、投机解码、KV Cache 压缩、CoT 压缩等技术,建设从效果评估到部署的完整闭环,在精度、延迟、吞吐、显存、成本和业务效果之间取得合理平衡。
  5. 大规模系统稳定性建设: 攻克千卡训练和高并发推理中的显存管理、跨节点通信、弹性容错、任务调度、请求迁移、故障检测、自愈恢复、灰度发布等挑战,提升训练成功率、推理 SLO 和集群资源利用率。
  6. 异构芯片与多模型适配: 负责训练及推理框架在 Nvidia GPU、国产 NPU / PPU 等硬件上的适配与深度优化,完成模型迁移、算子支持、Profiling、Kernel 调优、并行策略及服务架构优化,推动国产算力规模化使用。
  7. 大模型生产工具链建设: 打通训练、压缩、推理框架与训练部署及MaaS服务平台,建设可视化、自动调优、评估、故障诊断和部署等生产级能力,降低算法与业务团队的使用门槛。
  8. 业务协同与技术探索: 与算法和业务团队深度协作,支撑重点业务的算法探索与工程落地,通过算法与系统联合优化持续提升性能、稳定性和成本效率。

职位要求

  1. 具备扎实的代码能力、数据结构和基础算法功底,熟悉 Python / C++ / Rust 中至少一门语言,具备良好的工程实现能力和代码质量意识。
  2. 在大模型训练、推理或模型压缩至少一个方向具备深入实践,能够阅读和修改框架源码,并有性能优化或生产级工程落地经验。
  3. 熟悉至少一种主流训练、后训练或推理框架,如 PyTorch、Megatron、DeepSpeed、veRL、OpenRLHF、TRL、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等,并具备使用或二次开发经验。
  4. 理解分布式训练或推理的核心技术,包括并行策略、显存管理、跨机通信、KV Cache、请求调度、服务稳定性等;无需同时精通全部方向,但能够基于系统原理分析和解决复杂问题。
  5. 具备性能分析和问题定位能力,能够借助 Nsight Systems / Compute、PyTorch Profiler、日志、监控和实验分析等手段定位计算、通信、显存或系统瓶颈,并推动问题闭环。
  6. 能围绕吞吐、延迟、并发、稳定性、资源利用率、精度、成本和业务效果等指标进行系统分析,在技术效果与业务收益之间做出合理权衡。
  7. 具备良好的学习能力、沟通协作能力、自驱力和问题闭环意识,能够与算法、平台及业务团队协同推进技术落地。 加分项:
  8. 在大模型训练、推理、模型压缩、分布式系统或 MLSys 方向有高水平论文发表或优秀开源项目经历。
  9. 有千卡级大模型训练、后训练或大规模线上推理实战经验,解决过跨节点通信、显存优化、容错训练、高并发、故障迁移、弹性扩缩容或 SLO 保障等生产问题。
  10. 参与过 Megatron、DeepSpeed、veRL、OpenRLHF、vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo、AIBrix 等开源项目的核心模块开发或贡献。
  11. 有 CUDA Kernel、Fused Operator、Attention / GEMM、FlashAttention、PagedAttention 或通信计算重叠等底层优化经验。
  12. 有量化、蒸馏、剪枝、SmoothQuant、AWQ、GPTQ、KV Cache 压缩或投机解码等技术的工程落地经验。
  13. 有国产异构芯片(昇腾 Ascend、平头哥 PPU 等)训练或推理适配、Kernel 开发及规模化落地经验,熟悉 CANN / ROCm 等基础软件栈。
  14. 深入理解 GPU / NPU 硬件架构及性能瓶颈,能够结合 Tensor Core、内存层级、计算单元和通信拓扑进行差异化优化方案设计。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

小红书【2027校招】大模型 Infra 工程师

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看【2027校招】大模型 Infra 工程师正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位【2027校招】大模型 Infra 工程师小红书 · 北京市,上海市,杭州市

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏【2027校招】大模型 Infra 工程师正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

小红书【2027校招】大模型 Infra 工程师校招 · 北京市,上海市,杭州市

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入【2027校招】大模型 Infra 工程师内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。