岗位职责
- 容器镜像与 AI 模型权重分发:参与 Dragonfly、Nydus、Harbor 等开源项目的开发落地与上游维护,构建从镜像构建、分发到按需加载的全链路优化,推动云原生场景下 AI 模型权重分发的社区标准化;
- Agent 沙箱镜像加速:面向 Agent 服务与 SWE RL 场景,设计高并发、低延迟的沙箱镜像加载方案——从镜像按需加载、incremental snapshot、layer 共享到本地热缓存,让千级并发沙箱毫秒级就绪成为可能;
- 高性能存储:针对 AI 模型权重与容器镜像的 I/O 模式,优化存储链路——从镜像层存储、块设备、分布式缓存到本地持久化,让 TB 级模型分发的延迟降到极致;
- 高性能网络:优化 P2P 分发与模型拉取的网络链路,探索 RDMA/RoCE 在大规模镜像分发场景下的最佳实践,让带宽利用率逼近物理极限。
职位要求
- 对技术充满热情,具备强烈的责任心和自驱力,能快速掌握和应用解决问题所需要的技术,优先考虑具有开源社区工作背景的候选人;
- 具备扎实的编程能力、优秀的设计能力和代码品味,至少可以熟练掌握 Go/Rust 中的一种,并可以在需要时使用其他语言;
- 具备扎实的计算机专业基础,包括计算机体系结构、操作系统、存储技术、文件系统和网络等;
- 有细致的系统层软件性能调优经验——能找到瓶颈,能解释为什么慢,能用数据证明优化效果。 加分项(满足任一即可): ● 熟悉容器镜像与存储管控链路:containerd, runc, kata-containers, overlayfs 等; ● 有 Dragonfly, Nydus, Harbor, Ceph, JuiceFS 等镜像/存储相关项目经验; ● 有 RDMA/RoCE/NCCL 等高性能网络经验,或大规模 P2P 分发系统经验; ● 有 Linux VFS/块设备/文件系统内核开发经验; ● 有沙箱/微虚拟机(如 Firecracker, Cloud Hypervisor)快速启动或增量快照经验; ● 对主流开源软件有深入了解并对此有代码贡献; ● 具有自我驱动和自我管理能力,能针对系统的不足提出改进方案并推动实现。