岗位职责
- 负责大规模预训练语料生产链路的设计与落地,为基座模型训练提供稳定、可靠的高质量语料供给;覆盖数据寻源、抓取采集、多模态解析(OCR、图像、网页等)等全流程环节。
- 建设服务于预训练的一站式数据平台,围绕元信息、血缘关系、存储治理等要素管理语料的全生命周期;打造预训练语料的可视化与可观测能力,持续探索数据实验、数据版本管理的工程化边界。
- 面向 LLM、VLM 等模型场景,构建数据合成方案与配套框架,支撑语料规模化扩展(Data Scaling)等关键工作。
- 结合大模型训练语料的特点,抽象并沉淀高效、可靠的数据加工框架,全面提升算法工程师在数据处理环节的研发效率。
职位要求
- 计算机相关专业背景,熟练掌握至少一门主流编程语言(Go / Python / Java 等),具备扎实的工程实现能力;
- 具备良好的技术热情与自驱力,面对复杂问题能够独立思考、快速学习,愿意在数据与大模型交叉领域持续深耕;
- 深入理解大数据技术体系,熟悉 Spark、Flink、Kafka、Hive、HDFS 等主流组件的原理与实践;
- 对大模型技术栈及产品生态有较为深入的了解,关注前沿进展;
- 熟悉数据中台、机器学习平台等系统级平台的开发或使用经验。