岗位职责
- 负责湖库一体(Lakebase)数据平台的客户侧交付落地,覆盖部署实施、存量数据迁移、异构数据源打通、性能调优、故障排查与客户培训等全流程,确保项目按质按量上线,为客户AI场景(Agent、智能问数、多模态知识库)提供稳定可靠的数据底座。
- 负责存量数据(结构化、图片、音视频、PDF、向量等)的迁移与接入,保障迁移过程数据一致性与完整性。
- 负责异构数据源(MySQL、Oracle、Hadoop、对象存储、消息队列等)的连接打通与实时/批量同步配置。
- 负责湖库集群的性能调优:SQL 优化、冷热数据分层策略、混合搜索与向量检索延迟优化,协助客户完成高可用架构建设、备份恢复、监控告警与应急预案。
- 配合 DataStudio 建设,落地多模态数据接入、OCR/Embedding 等预制算子、任务编排、数据质量校验与全链路血缘。
职位要求
- 本科及以上学历,计算机、软件工程、电子信息等相关专业。
- 3年以上大数据平台交付、实施或运维经验。
- 熟悉 Linux 环境与 Shell/Python 脚本,具备自动化部署与故障排查能力。
- 精通 SQL,熟悉至少一种数据库(MySQL、Oracle、PostgreSQL、OceanBase 等),理解主从复制、高可用、备份恢复机制。
- 熟悉常见大数据生态组件(Hadoop、Hive、Spark、Flink、对象存储等)的部署与运维。
- 熟悉向量数据库、检索引擎(Elasticsearch、Milvus 等)或数据湖格式(Iceberg / Paimon / Hudi)。
- 了解大模型 / RAG / Agent 应用链路,有AI数据基础设施交付经验。
- 有 Kubernetes / Docker 容器化部署经验。
- 具备较强的沟通表达能力,能独立对接客户,有完整的项目交付经验。