部门介绍
字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。 从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。 如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。
- 负责火山引擎的ECS和VCI产品的功能开发、压力测试、性能优化、稳定性保障;
- 开发和维护虚拟机Guest OS内的基础资源监控软件、性能Profiling工具;
- 在全链路的视角下建设ECS/VCI产品的问题诊断工具、AI Agent。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 熟练掌握一门编程语言(如C/C++、Python、Go等),具备良好的算法、数据结构基础;
- 熟悉Linux OS的原理,熟悉其中关键组件,熟练使用一种或多种Linux发型版;
- 熟悉Linux内核的原理,如CPU调度、内存、中断、cgroup、设备驱动等子系统;
- 有Linux系统上性能调优、宕机分析方面的实战经验。 加分项:
- 拥有KVM虚拟化、Kata安全容器等经验;熟悉计算机体系结构,X86/ARM/RISC-V的主流CPU硬件;
- 了解Virtio、PCIE、CXL、RDMA等协议;具有云计算场景下的性能调优、故障排查的能力;
- 有AI Agent在实际工作项目中提效的经验。