岗位职责
- 训练数据体系构建:主导半导体领域大模型训练数据体系建设,包括领域语料(芯片设计、工艺、测试、失效分析文档、专利、行业报告)的采集、清洗、去重、质量评估与分级管控;
- 文档解析与数据生产Pipeline构建:设计并实现针对PDF、PPT、图表(wafer map、时序图、参数表)等非结构化文档的解析、结构化抽取与入库,持续优化解析准确率与吞吐能力;
- 术语库与知识库建设:主导半导体专业术语与缩写的归一化与对齐工作,支撑知识图谱构建及检索增强生成(RAG)语料准备;
- 指令数据与评测集运营:设计并运营有监督微调(SFT)指令数据与领域评测集,协同工艺、设计、测试专家制定标注规范,构建术语问答、参数查询、故障诊断类评测数据,跟踪模型幻觉问题并迭代优化;
- 大规模分布式数据处理平台搭建:基于Spark/Ray等框架搭建分布式数据处理任务,建立数据元信息、血缘与版本管理体系,保障敏感数据的合规流转与脱敏。
职位要求
- 教育背景与专业知识:硕士及以上学历,计算机、数据科学、AI或相关专业,能区分预训练、有监督微调、检索增强生成各阶段对数据质量与格式的不同要求;
- 专业技能与资格:能使用Python开发并维护数据Pipeline,能使用Spark、Flink或Ray等分布式框架完成TB级以上数据处理与性能调优;能使用非结构化文档解析工具(如PyMuPDF、OCR)完成PDF、图表、表格的结构化抽取;能通过Git、CI/CD进行版本管理与持续集成;
- 行业与专业经验:2年以上数据工程或大语言模型(LLM)数据处理相关全职工作经验,具有半导体电子行业文档处理经验者优先考虑;
- 项目/任务成果:主导完成至少一个大规模离线数据Pipeline从开发到上线的完整交付;主导完成至少一个LLM语料治理或非结构化文档解析项目,涵盖需求分析、方案设计、落地迭代全阶段;
- 其他要求:具有数据安全与合规意识,能设计敏感数据脱敏与分级保护方案;具有跨团队协作能力,能与领域专家及算法工程师对齐需求并主动推动问题闭环;有HuggingFace生态或开源语料项目贡献者优先考虑。