岗位职责
1)设计并实施大规模语料采集与处理系统,覆盖网页、书籍、代码、对话等多源异构数据; 2)制定数据清洗与去重等各类数据处理策略,提升语料多样性与质量; 3)开发数据质量评估与筛选体系,综合运用多维度方法对语料进行自动化打分与分级淘汰。包括困惑度过滤、质量分类器、内容安全过滤、数据配比与采样等; 4)主导合成数据的设计与生产,覆盖预训练增强与后训练两大场景,提升稀缺领域与长尾能力的数据覆盖,丰富推理、代码相关语料; 5)通过数据消融实验验证数据效果及数据配比策略,推动模型效果提升; 6)分析 MMLU / CMMLU / Humaneval 等开闭源训练指标,指导数据优化方向; 7)维护数据版本管理与数据血缘追踪系统,确保训练数据的可复现性。
职位要求
1)扎实的编程能力(Python必须,Java / Golang / Javascript 至少一种),良好的数据结构和算法基础; 2)熟悉软件工程基本流程(构建 / 调试 / 测试 / CI); 3)对代码质量、系统设计有基本理解; 4)具备数据质量判断分析能力; 5)理解大模型训练基本流程; 6)了解 Transformer 结构与训练特性; 7)了解相关训练指标(Loss / Entropy / Probs)。 加分项 加分项(满足部分即可) 1)有过大规模(PB级别)数据处理经验; 2)对分布式数据处理系统有应用经验(Hadoop / Spark / Dask / Ray); 3)有模型训练、效果实验的分析经验; 4)有特定领域数据的定向采集、分析、处理经验; 5)大规模训练或开源项目经验; 6)对存储硬件及各个系统性能有一定了解(HDFS / CFS / OSS )。