岗位职责
- 设计 AI 助手评测产品体系,覆盖大盘评估、策略迭代评估,建设自动化评估能力,让评估本身可规模化。
- 与产品和算法团队深度协作,把"产品质量"这种模糊的体感问题,拆解为可量化的指标体系与可执行的标注方案。
- 探索多模态场景下的评测方法,针对不同模态的特性设计差异化的评估框架。
- 推动评测结论真正落地——影响策略方向、影响产品决策、影响下一轮模型迭代。
职位要求
- 3年以内工作经验,有过完整的评测体系设计或搜索/推荐产品经验,理解 AI to C作为产品的核心逻辑与北极星。
- 理解 LLM 的能力边界与失败模式,对 AI 评测的自动化评估(含 LLM-as-a-Judge)、人机协同流程——有自己的判断和实践认知。
- 结构化思维强,能把含糊的质量诉求拆成可执行的指标树;具备跨团队协作的推动力,能让算法、产品、工程三方在同一套语言下对齐。