部门介绍
字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。
- 负责&参与Seed大模型训练的多模态数据平台架构演进以及推进落地,根据不同领域场景大模型落地需求,提出大模型训练和优化数据规模、数据类型、数据结构等建议;
- 负责&参与搭建多模态数据平台,支撑大模型数据的存储、预处理(去重、相似度计算、脱敏等)、可视化&分析、数据离在线打标和人工标注诉求,并且针对多模态数据场景、数据类型、数据规模有足够的扩展性,以支撑大模型数据集持续迭代,实现高质量数据集沉淀,从数据中挖掘出影响模型训练结果的可能因素,从而帮助模型训练改进;同时降低数据的获取门槛,提升数据的使用价值;
- 负责千亿级别海量多模态数据的管理,包括视频、图像数据的存储,数据处理,数据安全,数据校验等等;
- 负责多模态数据链路基建的研发,追求极致的处理速度,达到百万QPS的处理能力;
- 与Seed算法同学深度合作,加速训练数据的获取,提升数据质量,支持模型结果数据评测,打造数据闭环。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机、人工智能等专业,硕士学位及以上,具备3年以上数据处理或模型训练工作经验;
- 精通Python、Java等至少一种编程语言,具备良好的编码能力和代码质量意识;熟悉常用的数据处理、文本处理和图像处理库,能够高效地实现数据清洗和处理的算法和流程;
- 具备丰富的数据建模以及数据架构经验,能够对结构化和非结构化数据场景进行统一的建模;
- 熟悉Hive,ClickHouse,MySQL、MongoDB、ES等数据湖和数据仓库,了解底层原理,具备数据抽象和建模的能力;
- 熟悉Hadoop、Spark,Flink,Ray等大数据处理的相关经验;
- 具备出色的沟通和协作能力,注重细节、善于分析问题并解决问题。 优先:
- 主导过大模型或者离在线场景下的数据平台建设、海量的多模态数据平台建设、大数据开源框架者。