ARTICLE

AI评测方法论 - 四象限法则:不同场景的AI测评方法

三分法评测在问数项目遇到挑战。四象限法则重新定义场景分类:核心高频归集、高价值低频先拆后收、边缘定向、可延后忽略。

2026-05-22 · 1079阅读 · 6分钟

AI评测方法论 - 四象限法则:不同场景的AI测评方法

原文首发于人人都是产品经理,作者:李嘻嘻 原文链接:点击查看

去年做智能客服时用的是三分法:核心场景集(60%)、边缘场景集(20%)、高价值场景集(20%)。但最近做问数项目,发现还能再优化。

场景不同,做测评的方法也需要"因地制宜"。

新方案:分四个象限

第一类:核心高频场景(归集)

业务量最大的问题。怎么干:归集。 把相同意图、不同问法归并到一个评测单元,形成稳定"基本盘",准确率必须高(98%+)。

第二类:高价值低频场景(先拆后收)

出现次数不多但一旦出错就是大事故。怎么干:先拆后收。 先拆细(日环比/周环比/月环比),等模型能力上来后再合并成泛化能力。

第三类:边缘场景(定向)

错别字、方言、中英混搭。怎么干:定向优化。 挑频率最高的几个集中解决,其他先记录排期。

第四类:可延后场景(忽略)

出现极少且答错不影响核心体验。怎么干:忽略,转人工或兜底。 设硬性门槛:单月出现少于X次才可延后,每个版本至少解决10个之前延后的。

实际使用案例

案例一:退款场景 — 先拆成refund_broke/refund_leak/refund_other,分别标注测评,各子类达90%后再合并。

案例二:问数里的"环比" — 拆成日环比、周环比、月环比,分别训练,两周后合并成泛化能力。

需要注意的坑

  1. 拆得太碎维护成本爆炸 → 只有后端业务动作不同的才拆
  2. 忘了归集导致重复劳动 → 归集是第一步,拆是第二步
  3. 可延后变成永不解决 → 每个版本至少解决10个延后场景
  4. 什么时候拆什么时候收 → 准确率卡70%-80%且业务动作有分支时拆,子类超90%后尝试合并
  5. 归集需要强大的标注规范 → 用大模型生成同义问法再让标注员确认
  6. 边缘场景优先级判断 → 根据实际业务需求

结语:评测集是个活的东西

评测集不会是一次设计完美的,但一定要有一套机制让它能进化。

定期跑一次,看四类场景的准确率变化。随着业务需求变化,场景可能跨类别切换(比如突然从边缘到核心),灵活应对。

延伸阅读:评测基础方法看三分法构建评测集;问数项目实战看ChatBI企业级问数


关于作者

李嘻嘻,9年产品经理 + 3年AI实践者,专注于AI产品落地和工具开发。

  • 个人站:https://yourhelper.me
  • 项目:FormAI、TargetLink、XixiType等6个AI工具
AI评测四象限法则评测集问数项目