AI与编程

AI作品只报准确率不够:误判案例怎么分析

准确率是AI项目最常报告的指标,但它说明不了模型在哪里出错、为什么出错。本文介绍混淆矩阵的基本读法、误判样本的整理和归因方法,以及怎样根据误判分析设计改进实验。

文章目录展开收起

“我的模型准确率是88%。”这是很多AI项目报告里的核心结论。但评委通常会继续问:剩下的12%错在哪里?为什么会错?只报准确率,说明不了模型的真实表现。误判分析能让项目更有深度。

准确率说明不了什么

假设一个识别四类垃圾的模型,测试了100张照片,对了88张。这88%背后可能有很多种情况:

  • 四类都错得差不多。
  • 某一类几乎全错,其他类全对。
  • 两类之间经常互相认错。

不同情况,改进方法完全不同。

用混淆矩阵看错在哪里

混淆矩阵是一张表,行表示真实类别,列表示模型判断的类别:

真实\判断可回收物厨余垃圾有害垃圾其他垃圾
可回收物23002
厨余垃圾02401
有害垃圾10204
其他垃圾31021

对角线上是判断正确的数量。从这张表可以看出:有害垃圾有4张被认成了其他垃圾,是最主要的错误。

整理误判样本

把所有判断错误的照片单独拿出来,逐张记录:

照片真实类别模型判断可能原因
017有害垃圾(电池)其他垃圾电池很小,背景占了大部分画面
042有害垃圾(药盒)其他垃圾训练集中药盒照片很少
063其他垃圾(纸巾)可回收物纸巾和纸张外观相似

给误判归类

整理完后,把原因归成几类,统计每类有多少:

  • 物体太小或拍摄距离太远。
  • 训练数据中缺少这类物品。
  • 两类物品外观相近。
  • 光线或背景干扰。

哪类原因最多,就优先针对它改进。

根据分析设计改进实验

例如发现“训练集中缺少小物体的近拍照片”是主要原因,可以:

  1. 补拍50张电池、药盒等小物体的近距离照片。
  2. 重新训练模型。
  3. 用原来的测试集再测一次,比较前后结果。
版本总体准确率有害垃圾识别正确数
改进前88%20/25
补充小物体照片后92%24/25

有针对性的改进,加上前后对比的数据,比单纯“多训练几轮”有说服力得多。

承认模型的局限

有些误判很难通过补充数据解决,比如纸巾和纸张本身就很像,模型只看外观很难区分。在报告中如实写出这些局限,并提出可能的思路,例如结合重量传感器辅助判断,能体现学生对问题的深入思考。

误判分析的过程,其实就是在研究“模型是怎样看世界的”。这部分内容往往是AI项目中最能体现学生自己思考的地方。

资料与编写说明

原创方法文章,诺篮Stem编辑部根据项目指导经验整理

资料核验:2026-10-01
从阅读,走到自己的项目

孩子有想法,却不知从哪里开始?

带上兴趣、年级或已有作品,先聊清楚当前最需要解决的问题。

咨询项目方向
电话小程序预约免费咨询