部门介绍
字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。
- 系统可用性提升:面向百万级数据中心服务器和操作系统,与系统技术专家、SRE团队深度协作,设计和研发故障诊断和风险治理工具平台,保障系统软硬件的稳定性;
- 系统性能评测与分析:研发GPU性能基准用例,覆盖计算、通信、内存等维度;研发面向业务场景的CPU和GPU性能观测和分析工具平台;
- 设计并落地集群级GPU稳定性观测架构,覆盖XID错误码、ECC错误、NVLink状态、功耗等核心硬件的关键指标;
- 复杂问题攻关:参与重大故障应急响应,开展跨硬件/OS/应用的可用性与性能问题定位。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 本科及以上学历,计算机/电子工程/自动化等相关专业,3年以上AI系统基础设施或运维系统的开发经验;
- 深入理解GPU架构与故障模式,熟悉ECC错误、XID错误码体系、NVLink/IB互连拓扑、GPU相关软件;
- 具有GPU相关的基础知识,熟悉CUDA的基本使用,具有一定的CUDA编程能力;
- 编程能力:Python/Go编程能力扎实,具备系统级工具平台开发经验;
- 熟悉Prometheus+Grafana+ClickHouse等可观测性技术栈,具备AI集群指标采集与告警体系建设经验。 加分项
- 具备GPU平台的运维和调度相关的经验,熟悉AI业务场景的运维特点和故障模式;
- 支持过GPU集群通用模型训练/大模型推理优先;熟悉PyTorch,SGLang/vLLM等框架开发使用经验;
- 具备NVIDIA/AMD/国产GPU多平台性能评测与稳定性验证经验。