部门介绍
字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。
- GPU虚拟化研发:负责GPU虚拟化技术的底层研发与定制,包括GPU直通、vGPU、API转发等方案的实现与优化,提升GPU资源的利用率与隔离性;
- 算力池化引擎开发:设计并实现GPU算力池化组件,支持细粒度的GPU资源调度(如显存分片、算力切分),服务于AI训练和推理场景;
- 高性能计算适配:针对主流AI框架(TensorFlow、PyTorch)和HPC场景,优化虚拟化层的数据传输路径,降低虚拟化带来的性能损耗,追求接近裸金属的性能;
- 异构算力纳管:负责主流GPU(NVIDIA、AMD)及国产化GPU(如寒武纪、昇腾等)在虚拟化环境中的适配、驱动集成与兼容性调试;
- 故障排查与稳定性建设:深入分析Linux内核、KVM/QEMU及GPU驱动相关的疑难问题,提升智算平台在虚拟化环境下的可靠性与可观测性。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机或相关专业本科及以上学历,3年以上虚拟化或操作系统底层开发经验;
- 熟练掌握C/C++或Rust,能够编写高性能、内存安全的代码;
- 熟悉Linux内核架构,对进程调度、内存管理、文件系统及cgroup等模块有深入理解;
- 虚拟化技术栈:深入理解KVM机制、Virtio协议、VFIO直通方案,有QEMU、Firecracker开发经验;
- GPU虚拟化经验:熟悉NVIDIA CUDA、GDS、GDR方案,有GPU性能调优、算力切分开发经验;
- GPU互联加速经验:熟悉PCIe/RDMA/CXL/NVLink/UALink协议规范,有DPU/智能网卡的开发经验。 加分项:
- 曾有过GPU性能优化、算子优化、GPU驱动开发者优先;
- 在Linux内核、QEMU/KVM、Rust-vmm、Kata Containers等开源项目中有代码贡献;
- 对TensorFlow/PyTorch等主流AI框架,熟悉vLLM/SGLang等推理框架者优先。