岗位职责
针对数据仓库、搜索、推荐、机器学习等场景,优化EB级大数据存储系统的性能和成本,提供跨地域可横向扩展的能力,构建元数据系统,提供业务自动化迁移能力。
- 优化大数据存储系统(HDFS)的效能,使用多层次存储、EC编码等手段降低运营成本,利用操作系统层缓存、内存、NVME等设备优化存储系统的读写性能,提高上层应用的效率;
- 开发大数据存储系统(HDFS)的跨地域方案,利用有限的带宽和资源实现对用户透明、一致性的使用体验,保障存储系统多地域的可横向扩展性;
- 开发描述大数据存储的元数据系统,建立全局统一的目录树结构,简化上层应用与底层存储的交互,实现可横向扩展的元数据系统,并提供业务透明的自动化迁移能力,降低运维成本
职位要求
- 扎实的计算机理论和编程基础,熟悉常见的分布式理论和系统,熟悉JVM和Linux
- 对Hadoop生态组件熟悉,在大数据计算和存储相关领域有相关研发经验并有产品落地
- 具备科学清晰的问题解决思路,良好的沟通能力以及团队协调能力,崇尚数据价值和数据决策,富有责任心 加分项
- 有开发和运维过大数据系统经验
- 参与开源项目开发和向开源社区提供过代码