岗位职责
- 参与公司级大数据平台的整体架构设计,明确数据接入、批流计算、湖仓存储、研发治理、权限和运维边界;
- 建设多环境基础设施与平台工程体系,包括组织与账号、统一身份与访问控制、虚拟网络、跨环境网络互联、专线、密钥管理、审计、日志和成本基线;
- 建设以对象存储、开放表格式、开放 Catalog 和批计算引擎为核心的湖仓,解决分区、并发写、小文件、Compaction、Schema 演进和数据恢复问题;
- 建设 Kafka + Flink 实时数据平台,支持 CDC、事件时间、状态管理、回放、Savepoint 升级、故障恢复和端到端数据一致性;
- 建设统一的数据研发与调度体系,推动 Git、代码评审、自动测试、CI/CD、环境隔离、补数和发布回退标准化;
- 根据真实负载评估数据仓库、OLAP、训练平台、高性能文件存储和缓存等能力,避免不必要的产品叠加和技术锁定;
- 与模型训练团队共同建设训练数据链路,实现原始视频/图片管理、样本清洗、数据集版本、血缘、质量、合规和高吞吐读取;
- 建设平台可观测、SLO、容量、容灾、值班和故障演练体系,持续提升稳定性和可恢复性;
- 建设成本标签、预算、单位成本和容量模型,优化计算、存储、网络及训练数据读取成本;
- 沉淀平台规范、模板、SDK、自动化工具和 Runbook,支持数据研发团队自助接入。
职位要求
- 计算机或相关领域基础扎实,通常具有 3 年以上基础架构、大数据平台或分布式系统经验;
- 熟悉 Linux、网络、存储、身份权限和分布式系统基本原理,能够分析真实生产问题,而不只停留在产品配置层面;
- 熟练使用 Java、Scala、Python 或 Go 中至少一种语言,具备良好的 SQL、脚本和工程化能力;
- 参与过大规模数据基础设施或平台建设,理解统一身份与访问控制、网络、对象存储、日志、监控和基础设施即代码;
- 具备生产系统上线和运维经验,能够说明容量评估、灰度、回退、告警、故障定位和复盘方法;
- 具备清晰的文档和跨团队沟通能力,能够把架构方案转化为任务、接口、验收指标和运行规范。 【可深耕方向】 候选人不需要同时精通所有方向,但应在至少一个方向具备可验证的生产深度 方向一:基础设施与平台工程
- 熟悉多环境管理、统一身份与访问控制、虚拟网络、网络互联、密钥管理、审计和安全基线;
- 熟悉 Terraform/OpenTofu、GitOps、CI/CD、容器和制品管理;
- 有数据平台或 AI 平台基础设施标准化、SRE、FinOps 建设经验。 方向二:湖仓与离线计算
- 熟悉 Spark、Iceberg/Hudi/Paimon、对象存储和分布式 SQL;
- 理解 Catalog、事务、快照、分区、文件布局、Compaction 和性能调优;
- 有 Spark、分布式 SQL、数据仓库或数据研发调度平台的生产经验。 方向三:实时计算与数据平台
- 熟悉 Kafka、Flink、CDC、Schema 演进和流式状态;
- 理解 Exactly-once 的适用边界、Checkpoint/Savepoint、乱序、回放和数据对账;
- 有大规模实时任务稳定性、容量或平台化建设经验。 【加分项】
- 有大规模数据湖、流计算、分析型数据库或 AI 训练平台实战经验;
- 有同时面向国内与海外部署环境的经验;
- 有 PB 级数据、日增 TB 级链路、数百个作业或百人级数据研发平台经验;
- 有 AI/多模态训练数据、海量小文件、数据集缓存或高吞吐存储优化经验;
- 参与过数据平台从 0 到
- 异构基础设施迁移、机房迁移或平台容器化;
- 熟悉数据分类分级、个人信息保护、重要数据、等保、审计或数据出境相关要求;
- 有开源项目贡献、技术分享、专利或高质量技术文档。