岗位职责
- 探索 AI-aware 查询优化核心技术 面向 LLM、AI function、semantic operator 和多模态 workload,研究和实现下一代查询优化能力,包括 AI-aware cost model、语义算子重写、模型调用优化、推理成本优化、结果缓存与复用等。
- 建设面向 AI workload 的 semantic operator 体系 设计和实现 AI_FILTER、AI_CLASSIFY、AI_AGG / AI_SUMMARY_AGG、AI_EMBED、AI_SIMILARITY 等语义算子的优化能力,使 AI 计算不再只是黑盒 UDF,而是可被系统理解、规划和优化的一等计算能力。 优化向量检索、全文检索和混合检索执行路径
- 面向 RAG、知识检索、多模态搜索等场景,建设向量检索、全文检索、混合检索的统一查询优化能力,探索 filter pushdown、ANN / exact search 选择、top-k fusion、semantic rerank、retrieval + rerank 两阶段优化等策略。
- 构建多模态 AI pipeline 的增量计算能力 结合湖仓增量计算能力,探索文档解析、embedding 生成、分类、摘要、RAG 预处理等 AI function 的增量维护机制,降低多模态 AI 数据处理的计算成本和刷新延迟。
- 推动智能数仓走向 Agentic 自反馈优化 参与 Agentic AutoMV、智能数据排布、索引 / 排序 / clustering 推荐与自动应用等能力建设,探索由 agent 驱动的“发现问题—生成优化方案—自动应用—观测收益—自反馈调整”闭环。
- 打造 AI Native 数据基础设施的技术影响力 围绕 AI-aware 查询优化技术、semantic operator、Agentic Lakehouse、多模态增量计算、混合检索优化等方向,沉淀高质量技术方案、论文、专利和系统能力,提升团队在 AI + Data Infrastructure 方向的业界影响力。
职位要求
- 计算机相关专业博士
- 熟悉数据库系统、分布式系统、查询优化技术、机器学习系统、向量检索、大规模数据处理中的一个或多个方向。
- 对 AI Native 数据平台、Agent Native 工程体系、Agentic Lakehouse 和多模态数据处理有强烈兴趣,愿意探索 LLM、Agent、RAG、semantic operator、AI function、向量检索、全文检索、混合检索等前沿方向。
- 具备较强的问题抽象、技术判断和工程落地能力,能够将前沿 AI 技术问题转化为可运行、可优化、可观测、可规模化落地的系统能力。
- 有数据库、分布式系统、AI 系统、机器学习系统、Agent 系统相关顶会论文、开源项目、竞赛或高质量实习经历者优先。
- 愿意在 AI + Data Infrastructure 的交叉方向长期深耕,参与构建下一代 AI Native / Agent Native 湖仓基础设施。