岗位职责
- 负责机器学习系统存储相关组件的设计和开发,服务于各方向场景(NLP/CV/Speech等)的模型训练、模型评估和模型推理;
- 设计和实现面向训练/推理场景的多层级存储系统,综合利用显存、本地内存、分布式内存/磁盘、远端大容量存储系统(HDFS/对象存储)等多种介质进行数据的存储和迁移管理,实现「近计算缓存+远端大容量存储」的一体化分级系统,高效数据流动;
- 负责Kubernetes场景下多级存储系统的接入、管理、运维、监控,确保稳定性;
- 负责多机房、多地域、多云场景的系统搭建和容灾,优化跨集群的数据摆放。
职位要求
- 熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言;
- 熟悉Kubernetes架构和生态,熟悉PV/CSI等云原生容器存储技术,有丰富的机器学习系统实践和开发经验;
- 掌握分布式系统原理,参与过分布式系统的设计、开发和维护;
- 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应并采取行动;
- 有良好的工作文档习惯,按要求及时撰写、更新工作流程及技术文档。 加分项
- 熟悉至少一种主流的机器学习框架/推理引擎(例如vLLM/SGLang/PyTorch);
- 有大模型推理/训练相关的技术落地经验;
- 熟悉分布式缓存系统(例如Alluxio、JuiceFS、GooseFS、JindoFS)等;
- 熟悉NVLink、RDMA、NCCL、GPU Direct等技术。