岗位职责
- 理解大模型能力,跟进大模型评测领域的前沿研究范式,掌握定性和定量的用户研究方法,探索不同场景下AI回复模型的理想态牵引体系;
- 对Tako线上体验负责,综合内部专家评估、众测、LLM自动化评估等方式构建评测指标,找到体验短板并针对性地提出改进建议,帮团队量化和明确解决问题的优先级与方向;
- 协同国际化运营团队推动评估计划的实施,包含评测集的维护&沉淀、Benchmark评测例行执行与分析。
职位要求
- 硕士学位或以上,专业背景优先人工智能、计算机科学、认知科学、教育测量、社会科学定量研究;
- 在大模型评测领域有3年及以上工作及研究经验,设计过AI理想态评估机制,有用户研究、数据分析等项目经历;
- 工作细致有条理,逻辑清晰,沟通能力强,具备团队合作精神。