岗位职责
- 负责大模型数据平台的整体架构设计与演进,围绕数据的统一管理、检索发现、洞察分析与安全流通构建平台化能力,支撑大模型研发数据的高效、稳定供给。
- 主导数据检索、预览与数据集组织等核心能力的产品化建设,把算法与业务的用数诉求抽象为通用、易用、自动化的平台服务,持续提升数据的可发现性与可用性。
- 建设面向数据资产的洞察与追踪体系,实现数据底库、质量与全生命周期流转的可视化、可观测与可度量,为数据价值评估与决策提供支撑。
- 推动平台与研发全链路的开放集成,通过标准化服务与接口对内对外赋能,提升团队整体的用数效率与协同水平。
职位要求
- 硕士及以上学历,计算机、人工智能等专业优先,优秀者条件可适当放宽。
- 具备平台或大数据研发经验,精通Java、Python中至少一种,工程质量与系统设计能力扎实。
- 具备分布式、微服务与存储/检索系统实践:熟悉ElasticSearch/Lucene或向量检索引擎(Faiss/Milvus/HNSW等),了解相关性调优、召回与排序;熟悉鉴权体系(OAuth/STS/RAM)、任务调度与API/SDK设计。
- 熟悉数据湖与大数据栈:ODPS/MaxCompute、OSS、Hudi/Iceberg/Hive,以及Spark/Flink/Hadoop/Ray等计算框架。
- 具备良好的数据分析与洞察能力,能从数据中提取价值,驱动数据集建设与配比决策。
- 优秀的分析与解决复杂问题能力,良好的团队协作与沟通能力,能协调组内外资源推动项目落地。 加分项 ● 主导过大模型或离在线场景下的数据平台建设,具备海量图片/视频数据平台或大数据开源框架开发经验。 ● 多模态检索(以图搜图、图文)与embedding模型应用经验。 ● 数据血缘/元数据治理、数据分级与安全流通经验;了解大模型研发数据全流程。