岗位职责
- 构建高效主动、可持续的AI数据资产与治理体系(DataMap、数据价值主动发现、语料价值评估与分析、AI通用语料沉淀),推动数据团队从被动服务向主动增长模式演进,助力AGI业务高效、低成本达成目标。
- 提升数据研发的交付效率和业务决策效率,主导数据质量治理体系设计,开发数据去噪、清洗、打标、去偏和毒性检测算法。
- 研究基于LLM的合成数据生成框架,探索多模态数据合成(代码/数学推理/跨模态对齐)方法,探索多模态思维链合成增强、对抗性和合作性数据增强等技术路线。
- 跟踪大模型数据领域的前沿技术(如数据合成、智能标注等),开发或引入先进工具,持续提升数据生产的效率与质量。
职位要求
- 计算机、软件工程、数学与工程等相关专业本科及以上学历,有头部互联网公司大模型数据集经验优先。
- 理解大模型的应用与优化,能结合业务场景设计高效Prompt或微调方案,熟悉Agent工作流,具备多Agent协同开发经验更佳。
- 精通Python/Java/Go编程及常用数据处理库
- 3年以上以上扎实的数据工程、数据仓库或后端开发经验,或者至少1年专注于大模型数据集建设、大规模文本数据清洗或相关领域。 加分项:
- 有AI提效相关工具使用或项目落地经验,有处理文本、PDF、图像、音视频等非结构化数据的实战经验(如 PDF 解析、OCR 后处理、音视频转写等)。
- 具备数据资产估值方法论研究背景,有从0到1构建大规模数据清洗Pipeline并成功支持大模型训练项目经验。
- 了解大模型基本原理、训练和评估流程,有算法应用经验;关注行业技术动态,具备论文阅读与实现能力。
- 良好的沟通能力和团队协作精神,能够与团队成员高效合作。