招聘中 社招

系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施

字节跳动

  • 北京
  • 后端

收录时间

部门介绍

字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。

  1. 系统可用性提升:面向百万级数据中心服务器和操作系统,与系统技术专家、SRE团队深度协作,设计和研发故障诊断和风险治理工具平台,保障系统软硬件的稳定性;
  2. 系统性能评测与分析:研发GPU性能基准用例,覆盖计算、通信、内存等维度;研发面向业务场景的CPU和GPU性能观测和分析工具平台;
  3. 设计并落地集群级GPU稳定性观测架构,覆盖XID错误码、ECC错误、NVLink状态、功耗等核心硬件的关键指标;
  4. 复杂问题攻关:参与重大故障应急响应,开展跨硬件/OS/应用的可用性与性能问题定位。

岗位职责

招聘官网暂未提供完整岗位职责,请前往官网核实。

职位要求

  1. 本科及以上学历,计算机/电子工程/自动化等相关专业,3年以上AI系统基础设施或运维系统的开发经验;
  2. 深入理解GPU架构与故障模式,熟悉ECC错误、XID错误码体系、NVLink/IB互连拓扑、GPU相关软件;
  3. 具有GPU相关的基础知识,熟悉CUDA的基本使用,具有一定的CUDA编程能力;
  4. 编程能力:Python/Go编程能力扎实,具备系统级工具平台开发经验;
  5. 熟悉Prometheus+Grafana+ClickHouse等可观测性技术栈,具备AI集群指标采集与告警体系建设经验。 加分项
  6. 具备GPU平台的运维和调度相关的经验,熟悉AI业务场景的运维特点和故障模式;
  7. 支持过GPU集群通用模型训练/大模型推理优先;熟悉PyTorch,SGLang/vLLM等框架开发使用经验;
  8. 具备NVIDIA/AMD/国产GPU多平台性能评测与稳定性验证经验。

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

字节跳动系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施字节跳动 · 北京

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

字节跳动系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施社招 · 北京

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入系统可用性与性能工程专家(GPU性能与稳定性工程师) - AI算力基础设施内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。