岗位职责
- 参与构建高质量、多维度的数据样本集,支撑大模型在文本/图像/多模态等领域的分类分级任务;
- 协助设计数据标注规范,执行数据清洗、去重、增强及结构化处理;
- 配合算法团队完成数据质量评估与迭代优化,确保样本覆盖典型场景与边界案例;
- 编写数据处理脚本(Python、SQL),完成样本质量分析,样本抽取、加工、转换等工作;
- 沉淀数据分类分级领域相关知识。
职位要求
- 本科及以上学历在读,计算机、统计、数学等相关专业
- 熟悉Python编程,掌握Pandas/Numpy等数据处理库,熟悉SQL,有大模型使用和应用经验;
- 了解机器学习基础概念(如分类、聚类、数据偏差等),对大模型技术有浓厚兴趣;
- 具备严谨的逻辑思维与细节意识,能高效处理重复性任务;
- 加分项:有数据标注项目经验、熟悉Label Studio等标注工具、了解NLP/CV领域知识。