部门介绍
火山引擎是字节跳动旗下云和AI服务平台,将字节跳动快速发展过程中积累的增长方法、技术能力和应用工具开放给外部企业,通过云和AI技术,推进企业智能化转型,激发增长潜能。
- 负责具身智能数据闭环体系搭建与持续迭代,统筹多模态数据的采集回流、挖掘筛选、标注生产、质量管控、训练投喂全链路,构建高效的数据飞轮,支撑多模态大模型的持续训练与能力进化;制定数据闭环技术产品路径图,对数据供给效率、数据质量与迭代速度负责;
- 主导多模态数据平台的架构设计与工程落地,覆盖海量视频、点云、IMU、自然语言指令、动作轨迹等多源异构数据的存储、解析、计算与检索,建设PB级数据处理能力与高可用的数据服务,支撑大规模模型训练的数据吞吐需求;
- 负责数据挖掘与难例发现体系建设,设计基于模型不确定性、场景多样性与价值密度的主动学习策略,从实机回流数据中自动筛选高价值训练样本;建立场景分类与标签体系,实现数据的语义化索引与高效检索,支撑针对性的数据补充与场景覆盖;
- 主导自动化标注工具链与标注生产体系建设,推动基于大模型的多模态自动标注能力落地,实现视觉感知、语义描述与动作轨迹的联合标注与时序对齐;
- 负责数据质量与治理体系建设,制定数据质量标准与校验规则,建设数据一致性校验、时序同步校验、标注质量抽检等自动化质量管控能力;建立数据集版本管理与配比策略,实现训练数据的可追溯、可复现与可量化评估,保障模型训练的数据输入质量。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 5年及以上智能驾驶领域数据闭环、大数据平台或数据工程工作经验,有完整智能驾驶数据闭环体系从0到1搭建经验,有端到端或VLA大模型数据体系建设经验优先;
- 精通数据处理技术,深入理解分布式计算框架(Spark/Flink/Ray等)与数据湖技术(Iceberg/Hudi等),有多模态数据(图像、视频、点云)处理平台架构设计与落地经验;熟悉云原生架构与容器化技术,有高可用、可扩展的数据平台建设经验;
- 精通Python,熟练掌握Go/Java至少一门后端语言,具备扎实的工程编码能力与系统设计能力;熟悉MySQL/MongoDB/Elasticsearch/Redis等数据库与中间件,了解消息队列、流式计算与批处理架构;
- 深度理解智能驾驶算法与数据驱动的迭代逻辑,了解BEV、Occupancy、端到端、VLA等主流技术路线的数据特点与标注要求,能与算法团队高效对齐数据策略;
- 熟悉智能驾驶数据闭环全流程,包括车端数据采集、影子模式回流、数据清洗、难例挖掘、自动标注、仿真数据生成、训练数据生产等环节。