岗位职责
1)数据抓取与采集:负责从 web、社区论坛、App 等多源渠道进行结构化 / 非结构化数据抓取,包括文本、图像、音视频、代码等多模态数据。设计并实现高可用、高性能的分布式爬虫系统,处理大规模数据抓取任务; 2)数据清洗与预处理:针对大模型训练需求,设计并实现数据清洗、去重、规范化、分片、格式转换等处理流程。构建垃圾数据、低质数据、违规内容的识别与过滤规则,提升数据整体质量。对文本进行分句、语言检测、去噪、标点规范、编码修复等基础预处理; 3)数据质量评估与标注支持:与算法 / 训练团队协作,制定适用于预训练、指令微调(SFT)、对话数据等不同场景的数据质量标准与评估指标;
职位要求
1)计算机、软件工程、数据科学等相关专业本科及以上学历; 2)1年及以上数据抓取、爬虫开发、数据清洗处理相关工作经验,有大规模数据项目经验者优先; 3)理解常见网站的技术栈与反爬机制(UA / Cookie / IP 限制 / JS 加密 / 动态加载等),有实战应对经验; 4)有分布式爬虫架构经验,熟悉任务调度、队列、代理池、失败重试、断点续传、去重机制等常见设计; 5)对性能优化有实际经验,能在抓取效率与稳定性之间进行合理权衡; 6)熟悉数据清洗、去重(如基于 hash、MinHash、SimHash)、采样、合并、分桶等常见方法。 加分项 1)有大模型训练数据相关经验:如中英文网页语料、代码语料、对话语料、多模态数据等采集或处理经验。 2)有参与构建 TB 级别以上数据集的经验,能分享完整的数据流水线设计或案例。 3)了解常见 NLP 任务(语言模型、对话、检索、对齐等)或有与算法团队深度协作经验。