ARTICLE
AI评测集构建 - 三分法:告别拍脑袋式迭代
没有评测集迭代就是拍脑袋。三步法从零构建AI评测集:定义范围标准、收集标注数据、分层切片分析,附自动化评测流水线。
2026-04-29 · 789阅读 · 7分钟
AI评测集构建 - 三分法:告别拍脑袋式迭代
原文首发于人人都是产品经理,作者:李嘻嘻 原文链接:点击查看
智能客服上线一个月,算法同学说"准确率又涨了2个点",运营同学却说"用户投诉更多了"。
——没有统一的测评集,大家都在自说自话。
本质:评测集是AI产品的"导航系统"
没有评测集,迭代就是拍脑袋。评测集就是你的导航系统。
一个好的评测集应该做到:覆盖全面、标注一致、持续更新、自动化。
三步法:从零到一构建高质量评测集
第一步:定义范围与标准
(1)划定业务范围:与业务方共同确定必须覆盖的用户意图。定义了12个一级意图——查询订单状态、申请退款、咨询商品信息等。先覆盖高频意图(占80%流量)。
(2)制定标注规范:为每个意图制定清晰、无歧义的标注规范。每周开标注对齐会讨论争议案例。
第二步:收集与标注数据
数据来源:脱敏后的真实用户日志,按意图分层采样。冷启动期可用人工撰写+大模型生成同义句。
数据增强:基于种子问法让大模型批量生成同义句,评测集大幅扩充。
标注与质检:3人标注团队,标注和审核角色分离——标注员打标签,质检员抽20%复核,仲裁员裁定争议。用Label Studio作为标注工具。
第三步:分层与切片
划分三个子集:
- 核心场景集(60%):高频标准问法
- 边缘场景集(20%):错别字、方言、中英混搭
- 高价值场景集(20%):涉及退款、投诉等高业务价值场景
切片分析能清晰发现:"模型在核心场景稳定,但处理口语化表达时准确率下降。"
自动化评测流水线
代码提交 → 烟囱测试 → 模型训练 → 跑全量评测集 → 指标对比基线 → 达标则自动部署
每次评测结果自动发送企微群,附带详细报告:整体准确率变化、每个意图的准确率明细、Top 10错误样本。
落地遇到的三个坑
坑一:标注标准不一致 → 制定规范文档+培训+考试+每周对齐会
坑二:测试集过拟合 → 测试集由产品经理保管,算法团队只能看到评测结果
坑三:评测集增长太快 → 定期瘦身,保持核心样本2000条以内
评测集依然搞不定的场景
- 主观性问题:直接转人工或走推荐系统
- 多轮对话评测:引入人工盲测
- 生成式答案评测:先用检索式,评测集成熟后再尝试生成式
结语
评测集是一个活的东西。它需要持续维护、持续更新、持续和业务对齐。有了它,算法、产品、运营才能坐在一张桌子上说话。
关于作者
李嘻嘻,9年产品经理 + 3年AI实践者,专注于AI产品落地和工具开发。
- 个人站:https://yourhelper.me
- 项目:FormAI、TargetLink、XixiType等6个AI工具