岗位职责
随着数据量的爆炸性增长以及业务复杂性的增加,诸如图、文档、时空、时序等非结构化数据类型规模和价值都越发重要。需要研究更有效率的非结构化数据的处理、存储、分析的技术,尤其是与结构化数据融合进行分析的手段,将来自不同来源、格式、结构或模型的数据整合到一个统一的系统中,以实现数据共享、分析和决策支持。 我们的研究内容包括:
- GPU加速的多模态数据处理,如fts、向量检索以及索引建立。GPU高效池化以及远程GPU调用,查询算子以及后台数据重整任务的高效远程GPU卸载;
- 非结构化数据,如json、文档等自动语义发现与解析、数据模式匹配与语义对齐、对象关联分析。结合NLP等技术,实现从原始数据到结构化语义的高效转化;
- OLTP高效入湖。结合数据湖的灵活性(存储非结构化数据)与数据仓库的结构化管理能力(如ACID、事务支持、元数据管理),通过存储层创新、计算引擎优化和云原生技术,实现不同业务的高效协同。
职位要求
1)扎实的工程能力,优良的编程风格,熟悉C++语言和常用设计模式,具备复杂系统的调试与开发能力; 2)优秀的沟通表达能力、团队合作意识和经验;具备快速学习的能力,以及深入钻研技术问题的决心; 3)掌握数据库领域优化/执行/存储等各方向基础知识,有扎实的高性能计算(GPU/x86/等)、高性能索引、或多模态数据分析领域的经验。 加分项: 1)有突出的学术背景和创新研究能力,在顶会顶刊发表过相关论文; 2)对数据库系统特别是实时数据分析/湖仓分析/硬件加速某一个方面有专业独到的研究。