岗位职责
- 参与构建高质量、多维度的训练/验证/测试样本集,支撑敏感数据识别模型在文本、图像、多模态场景下的分类与检测任务;
- 协助设计并迭代数据标注规范,执行数据清洗、去重、增强及结构化处理,保障样本质量与一致性;
- 参与分类模型的训练、调参与效果评估,针对 bad case 进行归因分析并驱动样本补充与策略优化;
- 基于模型预测结果与线上反馈,完成数据飞轮闭环中的样本挖掘、难例筛选与主动学习流程,持续提升模型准召;
- 编写数据处理与评估脚本(Python、SQL),利用大模型能力辅助标注、质检与知识抽取,推动标注流程 AI-Native 化;
- 沉淀敏感数据识别领域知识,将分类定义、判定规则与边界案例结构化为可被模型消费的知识资产,驱动数据飞轮持续运转。
职位要求
- 本科及以上学历在读,计算机、统计、数学、人工智能等相关专业;
- 熟悉 Python 编程,熟悉 SQL;
- 掌握机器学习、深度学习相关概念,有模型训练调优经验;
- 具备"数据驱动"思维——能从模型表现反推数据短板,形成"发现问题→补充数据→验证提升"的闭环意识;
- 有良好的知识归纳与文档沉淀习惯,能将零散经验提炼为可复用的规则与标准;
- 加分项:有 NLP/多模态相关课程项目或竞赛经验;有数据标注项目经验;了解主动学习、数据增强或 LLM-as-Judge 等数据飞轮相关方法。