岗位职责
- 跟踪行业前沿的AI模型评估范式,为评估策略提供外部视角与创新思路,结合剧情与角色方向的评估目标,制定模型评估标准,致力于制定可成为行业共识的对话类基准(Benchmark);
- 构建可复用的工作流(Workflow),从数据和模型层面优化评估过程和题库设计,确保评估的准确性和目标达成,探索自动评估、人工评估与线上模型迭代实验相结合的机制与流程;
- 深入分析评估数据,挖掘数据背后的潜在趋势和问题,为产品研发团队提供详细且有针对性的反馈,助力模型性能的持续优化与提升;
- 维护与协作部门良好、有效的沟通机制,从专业视角确保模型评估报告的可靠性,保证评估结果能够准确传达,形成有效反馈与协作链路;
- 统筹团队开展评估任务,根据项目规划和目标,精准拆解评估任务,保证团队高效、有序达成既定目标,定期组织内部培训,提升团队成员的业务能力与专业素养。
- 本科及以上学历,理工科专业包含计算机、统计学、软件工程、人工智能等,文科专业涉及汉语言、传媒、戏剧等,具有复合型学科背景者优先;
- 有文本模型相关评估经验,具备优秀沟通协调能力和团队协作意识,有项目管理经验优先;
- 具备Python编程能力,熟悉大模型数据生产流程,且拥有产品思维,能够深入剖析用户需求,具备较强的洞察能力;
- 具备用户视角及产品思维,有文娱生态类行业的从业经验优先,深度理解娱乐化游戏特点(如:二次元、乙女游戏、网络小说、剧本杀、互动小说等各分类),能准确判断模型剧情编造能力、对话趣味性,反映用户真实满意度。
职位要求
招聘官网未单独提供职位要求,请前往官网核实。