岗位职责
【岗位定位】 作为大模型数据基础设施的核心建造者,此岗位专注于研发高性能、云原生的分布式多模态计算与存储引擎。你将打造支撑PB级多模态数据处理的底层平台,为上层的数据处理流水线与模型训练提供稳定、高效的基础设施,是连接海量数据与强大模型的关键桥梁。 【岗位职责】 负责设计与研发面向大模型训练的超大规模多模态数据底层计算与存储引擎,核心是基于Ray框架构建高性能、高可用的分布式数据处理平台。 深度优化Ray框架的核心组件,包括但不限于任务调度、内存管理、容错机制,以支撑EB级别多模态数据(文本、图像、视频、音频)的预处理和迭代效率。 探索并集成新一代列式存储格式(如Lance),设计并实现多模态数据(尤其是非结构化数据)的统一、高效存储方案,优化向量化查询和随机访问性能。 负责计算引擎的云原生部署与稳定性保障,包括Kubernetes集群管理、资源调度、监控告警体系,确保平台服务的高可用性与可扩展性。 跟踪业界先进技术(如Ray, Lance, Arrow等),参与开源社区贡献,并将前沿技术转化为团队的核心生产力。
职位要求
】 计算机科学、软件工程或相关专业本科及以上学历,5年以上大数据基础架构或分布式系统研发经验。 精通Python和C++,具备扎实的计算机基础(数据结构、算法、操作系统、网络),有大规模系统软件的性能调优和故障排查经验。 深入理解分布式系统原理,有分布式计算/存储引擎(如Ray, Spark)内核开发或深度优化经验者优先。 熟悉一种或多种数据存储格式(如Parquet、ORC、Iceberg)或向量数据库底层原理,有Lance、Arrow相关经验者优先。 具备良好的团队协作精神和沟通能力,对技术有热情,有较强的自驱力和学习能力。 【加分项】 在Ray、Spark等知名开源项目中有活跃贡献。 有处理PB级以上多模态非结构化数据的技术架构经验。 熟悉Kubernetes及云原生技术栈,有大型分布式系统在云上的部署和运维经验。