部门介绍
字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。
- 参与字节跳动泛调度系统建设,覆盖资源配额、跨地域与跨集群调度、单集群调度和单机资源管理等环节;
- 面向在线服务、大数据计算、AI训练与推理、数据库和存储等负载,设计统一的资源表达、配额、优先级、抢占、弹性和容灾机制;
- 解决超大规模调度系统中的性能、可用性、一致性、资源碎片、热点及调度质量问题;
- 推动GPU、CPU、内存、SSD、网络、内存带宽和电力等多维资源的联合调度与精细化管理;
- 面向大模型训练与推理场景,建设Gang调度、GPU拓扑亲和、异构卡型适配、GPU共享、弹性资源池及碎片治理等能力;
- 建设资源画像、智能策略、仿真评估和实验反馈体系,通过调度、重调度、弹性伸缩、混部和并池等手段,支撑AI弹性资源池、资源并池、数据库上云等公司级项目,将系统能力转化为稳定性、交付效率和成本收益。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 具备扎实的计算机基础,熟悉数据结构、算法、操作系统、计算机网络和分布式系统;
- 熟练使用Go、C++、Java、Rust等至少一种编程语言,具备良好的系统设计和工程实现能力;
- 熟悉Kubernetes、Yarn、Mesos、Slurm等至少一种资源管理或调度系统,理解其核心架构和调度机制;
- 对集群、资源调度或系统性能有深入兴趣,能够分析和解决复杂的生产系统问题;
- 具备较强的系统抽象和数据分析能力,能够在业务需求、系统复杂度、稳定性和资源效率之间做出合理取舍;
- 具备良好的沟通和推动能力,能够与业务、SRE、内核、服务器、网络、存储等团队共同推进复杂项目。 加分项:
- 有集群管理、资源调度、资源混部、容量规划或资源利用率优化经验;
- 熟悉GPU调度及硬件拓扑,包括异构卡型、Gang Scheduling、PCIe、NUMA、NVLink、NVSwitch、GPU共享或碎片治理;
- 熟悉AI训练与推理工作负载,以及CUDA、NCCL、RDMA、PyTorch、TensorFlow等相关技术;
- 具备运筹优化、机器学习、强化学习、仿真系统或在线实验平台的研发经验;
- 有Kubernetes、调度系统、容器运行时或Linux内核等开源社区贡献经验。