岗位职责
- 主导数据标注与模型评估项目,负责多个项目的端到端执行管理,确保同时达成标注质量目标、服务水平协议以及模型性能基准;
- 设计与执行AI模型评估,开发或优化评估框架,创建测试用例、数据集(包括对抗性及安全聚焦的用例),对大语言模型输出结果进行评估,并衡量内容治理场景下的准确性、安全性、相关性、偏差及鲁棒性等指标;
- 分析模型性能并提供优化建议,深入剖析评估结果,对模型故障或质量问题执行根本原因分析,识别错误模式,并将分析结论转化为具体的建议,用于改进标注指南、数据采集策略、模型微调或流程变更;
- 作为主要利益相关方对接窗口,将产品、安全及业务需求转化为清晰的标注与评估要求,就目标与成功指标达成共识,并向算法团队、产品团队及管理层展示评估洞察与建议;
- 推动交付治理、跨部门协作与持续优化,建立运营节奏,组织评估复盘,在质量保证团队、供应商、标注团队及业务相关方之间构建升级上报框架,利用数据进行绩效管理,监控标注指标与模型指标仪表板,发现异常并执行深入数据分析与根本原因分析,推动质量与效率持续改进;识别标注质量与模型性能差距,设计流程改进方案、混合(机器+人工)标注策略及自动化机会,与工具团队和算法团队合作提升评估能力,负责风险与变更管理,主动识别数据质量、模型安全性或交付时间线相关风险并提出缓解计划,主导运营过渡,提供战略汇报,将标注与模型评估数据整合为清晰洞察、绩效摘要及前瞻性建议,向管理层及跨部门合作伙伴汇报。
职位要求
- 本科及以上学历,数据科学、统计学、数学、计算机科学或相关专业优先;
- 5年以上AI模型运营工作经验,需在AI数据标注、数据运营、内容审核或AI模型评估领域具备项目/项目集管理经验;
- 具备3年以上AI/大语言模型评估实践经验,包括设计评估方法、分析模型输出、对性能问题进行根本原因分析,并提供可落地的模型改进建议;
- 具备3年以上区域团队管理经验,有成功领导项目经理团队或类似角色的能力;
- 英语听说读写流利,具备利益相关方管理和沟通能力,可向区域/全球团队展示复杂的评估发现与建议;
- 熟练掌握Excel、SQL及仪表板开发,有运用数据驱动方法进行绩效分析、根本原因调查以及推动运营/流程改进的实践经验。 优先资格
- 具有大语言模型训练、微调或评估的直接经验(例如安全对齐、红队测试、偏好/奖励建模或RLHF工作流);
- 具有实施或优化机器标注、混合(人机)标注或自动化评估流程的实践经验;
- 熟悉与内容安全及生成式AI相关的评估指标和基准;
- 持有项目管理认证(PMP,Agile,Lean Six Sigma)或同等资格。