招聘中 社招

AI基础设施架构师/高级AI基础设施研究员-基础设施

字节跳动

  • 北京
  • 后端

收录时间

岗位职责

  1. 端到端AI Factory架构设计:负责超大规模、高可用AI Factory的端到端架构设计与演进;主导面向万卡/十万卡级GPU/加速器集群的计算、高性能网络(RDMA/RoCE/
  2. 6T/CPO)及低延迟存储系统的协同设计,支撑百亿/千亿参数大模型(LLM/VLM)的高效Pre-training和超大规模分布式Inference工作负载;
  3. 下一代分布式调度与资源管理:设计并实现面向服务(SOA/MicROServices)的下一代AI/ML分布式调度系统与集群联邦架构(基于Kubernetes、高性能调度插件或自定义编排框架);利用智能资源流转、工作负载感知放置(Topology-aware placement)与故障自动恢复(Fault-tolerance)机制,极致提升集群算力利用率(MFU/HFU)并降低TCO;
  4. 全栈性能极致优化与瓶颈分析:全链路剖析并优化AI/ML计算堆栈:涵盖机器学习编译器(XLA/TVM/Triton)、通信库(NCCL/RCCL)、算子优化、大模型训练/推理框架(Megatron-LM,DeepSpeed,vLLM等);主导构建低开销(Low-overhead)的分布式Metrics监控、可观测性系统及微基准测试(Micro-Benchmarking)框架,精准定位并消除超大规模集群的系统级长尾瓶颈;
  5. 下一代高性能存储与数据管道:针对大模型长周期训练的Checkpointing、多模态海量数据预处理、以及推理场景下的长文本/高并发需求,设计下一代高性能分布式存储、缓存系统及存算一体架构;主导构建高吞吐的分布式ETL与数据摄取管道。

职位要求

  1. 硕士学位及以上,计算机科学、计算机工程、电子工程或相关专业;
  2. 工作经验:5年以上高并发/分布式系统工程经验,其中至少3年聚焦于ML/AI基础设施领域,有GPU集群实践经验者优先;
  3. 技术功底:深入理解现代GPU/加速器微架构、高速互联架构(NVLink/NVSwitch)及数据中心网络(RDMA/RoCE/InfiniBand);精通至少一种主流分布式训练/推理框架的底层源码与优化机制;具备扎实的系统编程能力,精通C++、Go或Rust,并具备深厚的Python底层开发与调试功底;
  4. 素养:具备出色的第一性原理(First-princIPles)思考能力,面对复杂的软硬件级联故障能迅速推导本质,具备优秀的技术前瞻性。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动AI基础设施架构师/高级AI基础设施研究员-基础设施

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看AI基础设施架构师/高级AI基础设施研究员-基础设施正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位AI基础设施架构师/高级AI基础设施研究员-基础设施字节跳动 · 北京

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏AI基础设施架构师/高级AI基础设施研究员-基础设施正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动AI基础设施架构师/高级AI基础设施研究员-基础设施社招 · 北京

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入AI基础设施架构师/高级AI基础设施研究员-基础设施内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。