岗位职责
- 参与数据资产与数据生产平台的架构设计和核心模块研发,建设工作流、元数据、数据集、算子、任务和发布等领域能力;
- 建设统一的数据加工工作流,支持 DAG、批量并行、长任务、优先级、重试、断点续跑、幂等、补数和失败回滚;
- 建设文本、图片、视频、音频等多模态数据处理框架,支持解析、转码、抽帧、切片、格式转换、特征提取和批量推理;
- 将清洗、过滤、去重、质量检测、采样、标注、审核等能力沉淀为标准算子、SDK、模板和可组合工作流;
- 建设数据集管理能力,包括 Dataset、Manifest、Schema、分片、快照、版本、血缘、标签、训练/验证/评测集划分和发布审批;
- 建立数据生产质量体系,支持规则校验、统计分析、分布检测、异常发现、抽样审核、质量评分和问题回溯;
- 建设数据生产任务的可观测体系,持续跟踪吞吐、延迟、失败率、有效数据产出率、资源利用率和单位数据成本;
- 优化海量文件、对象存储、缓存、索引、并行计算和数据布局,提升数据加工及训练读取效率;
- 建设身份权限、敏感信息处理、授权范围、审计、保留和删除传播能力,保证数据被合规使用;
- 对接训练和评测系统,通过 API、SDK 或数据清单稳定交付不可变的数据集版本,并保证结果可复现;
- 参与技术规范、代码评审、自动化测试、发布、值班、故障处理和复盘,持续提升平台工程质量;
- 深入理解算法和数据运营团队的生产流程,推动复杂人工流程标准化、自动化和产品化。
职位要求
- 通常具有 3 年以上后端研发、数据工程、机器学习平台或分布式系统经验;
- 熟练使用 Python、Java、Go、Scala 或 C++ 中至少一种语言,具备扎实的数据结构、算法和工程能力;
- 熟悉 Linux、网络、存储、数据库、消息队列、并发编程和分布式系统基本原理;
- 熟悉 SQL 和大规模数据处理,使用过 Spark、Flink、Ray 或同类分布式计算框架中的至少一种;
- 理解工作流系统常见问题,包括状态管理、任务依赖、幂等、重试、超时、补数、资源隔离和故障恢复;
- 具备生产系统研发和运维经验,能够对性能、稳定性、数据正确性和成本负责;
- 能够把不确定的数据加工需求抽象为清晰的领域模型、接口、算子和平台能力;
- 具备良好的文档、沟通和跨团队协作能力,能与算法、训练、产品及数据治理团队共同推进交付。 【可深耕方向】 候选人不需要同时精通全部方向,但应在至少一个方向具备可验证的生产深度 方向一:平台后端与工作流
- 熟悉任务调度、工作流编排、分布式任务执行、资源配额和多租户设计;
- 能设计高可用 API、元数据服务、状态机、事件机制和插件/算子框架;
- 有复杂平台从需求抽象、核心开发到生产运维的完整经验。 方向二:大规模数据加工
- 熟悉 Spark、Ray、Flink 或其他并行计算框架的执行与调优;
- 熟悉对象存储、列式存储、文件布局、缓存、索引和海量小文件治理;
- 能处理数据倾斜、重复计算、Shuffle、热点、吞吐和资源利用率问题。 方向三:多模态数据与质量
- 熟悉文本、图片、视频或音频中至少一类数据的解析和加工链路;
- 了解去重、质量打分、内容过滤、数据泄漏检测、样本均衡或模型辅助数据处理;
- 能将算法原型转化为稳定、高吞吐、可复现的生产任务。 方向四:数据资产与平台产品
- 熟悉数据目录、Dataset/Manifest、Schema、版本、血缘、质量和生命周期管理;
- 能设计面向算法和数据运营人员的 API、SDK、工作流或平台产品;
- 理解训练数据发布、审批、复现和问题追溯的完整流程。 【加分项】
- 有大模型、推荐搜索、计算机视觉、语音或多模态训练数据平台经验;
- 有 PB 级数据、十亿级样本、海量小文件或大规模视频处理经验;
- 有数据去重、相似度检索、Embedding、OCR、ASR、内容理解或质量评估经验;
- 有人工标注、模型辅助标注、主动学习、数据闭环或合成数据生产经验;
- 有 Kubernetes、批任务调度、GPU 资源调度、容器化或弹性任务平台经验;
- 有数据版本、实验复现、数据污染检测、评测集保护或训练数据治理经验;
- 有面向内部用户的平台产品研发经验,关注易用性、可维护性和自助化;
- 有开源项目贡献、技术文章、专利或高质量系统设计文档。