岗位职责
- 设计和开发大规模预训练数据处理链路,为基座模型预训练提供稳定、可靠的高质量数据处理能力,包括数据寻源、数据抓取/采集、数据解析(OCR、图片、网页)等工作内容;
- 设计和开发服务大模型预训练的数据平台,管理数据的元信息、血缘、存储治理等数据全生命周期要素;提供预训练数据的可视化、可观测能力;探索数据实验、数据发版的工程上限;
- 针对LLM、VLM等模型构建数据合成方案和框架,支持数据Scale等工作;
- 根据大模型训练数据特点,抽象并开发高效、可靠的数据加工框架,提升所有大模型算法工程师处理数据的工程效率。
职位要求
- 熟悉至少一种编程语言,如Go,Python,Java等;
- 对大数据技术有深入的理解加分,熟练掌握如Spark、Flink、Kafka、Hive、HDFS等工具加分;
- 有数据中台、机器学习相关的系统平台开发、深度使用经验加分;
- 对大模型技术、产品生态有深入了解加分;
- 有面对技术挑战的热情,能独立思考,具有好奇心和快速学习能力。