岗位职责
- 负责面向AI场景的分布式存缓系统的架构设计与研发,针对AI训练、推理、计算等应用场景持续优化;
- 负责多个系统模块的性能、稳定性优化以及关键技术攻坚,提升大规模生产环境下的数据访问效率和SLA;
- 负责优化AI训练和推理的IO链路,充分发挥高速硬件能力,提升资源利用率和降低数据存储成本;
- 跟进业界趋势,进行新技术预研、前沿技术的引⼊和落地。
职位要求
- 计算机或相关专业本科及以上学历,3年以上相关⼯作经验,对分布式系统、缓存、存储、硬件加速、模型训练与推理等任一方向有深入研究者优先;
- 具有Linux后台开发经验,熟悉C++/C/Python/Java等一种或多种语言和调试工具,具有丰富的工程经验;
- 熟悉常用的算法和数据结构,具有良好的软件工程意识,有高并发、大规模后台服务开发经验优先;
- 了解业界常见的分布式存缓系统,比如Alluxio、3FS、CEPH、AWS-S
- JuiceFS等,对RDMA、FUSE、文件系统有实际经验者更优;
- 了解模型训练和推理的过程,对训练数据和模型加载、checkpoint、KVCache、GPU、训练和推理框架有了解者更优;
- 具有优秀的学习能力、分析和解决问题能力、沟通能力、团队合作意识,具有强烈的责任心与主动性,对所负责工作有owner意识;
- 有开源项目贡献,参与顶会发表论文等贡献者优先。