岗位职责
定位 负责具身AI一站式数据平台的架构设计与系统开发,覆盖平台基建(湖仓架构、高并发存储、中间件)与数据处理Pipeline(清洗、质检、格式转换),支撑从原始采集数据到可训练数据的全链路闭环。区别于数采系统岗(聚焦采集端硬件接入与实时传输),本岗聚焦数据落盘后的存储、治理与消费。 职责
- 设计并落地平台数据存储架构(数据湖/仓),支持PB级多模态数据(图像、点云、轨迹、视频)的高效入库、检索与版本管理
- 开发平台核心后端服务(采集管控、任务调度、权限管理、数据导出),保障并发场景下的系统稳定性与性能
- 开发数据清洗与预处理Pipeline,实现异常轨迹过滤、缺帧插值、坐标系对齐、格式标准化,支持跨格式(ROS bag/HDF5/LeRobot)互转与跨本体数据对齐
- 搭建数据可视化与审核模块(轨迹3D回放、多视角对比、标注审核),配合算法团队定义训练数据规范(episode结构、action/observation字段)
- 制定数据质量标准与验收规范,输出分布统计与质量报告,定位数据问题并驱动上游优化
职位要求
要求
- 硕士及以上,计算机、软件工程、自动化、机器人相关专业, 或者有同等相关工作经历
- 熟练掌握Python或Go/Java,有高并发Web服务或数据处理Pipeline开发经验(Pandas/NumPy/SciPy)
- 熟悉数据库(MySQL/PostgreSQL)、对象存储(OSS/S3)与数据湖(Hive/Iceberg/Delta Lake)中的至少一种
- 了解机器人数据结构(轨迹、关节状态、多模态时序数据),能独立完成数据分布统计与质量评估 加分项
- 有大规模数据平台或湖仓一体架构设计经验
- 熟悉具身AI数据格式(ROS bag/LeRobot/HDF5)与episode/action/observation结构
- 有3D可视化开发经验(Three.js/foxglove/Open3D)或前端基础(React/Vue)
- 熟悉容器化部署(Docker/K8s)或大规模批处理框架(Spark/Dask)