AI与编程
AI作品只报准确率不够:误判案例怎么分析
准确率是AI项目最常报告的指标,但它说明不了模型在哪里出错、为什么出错。本文介绍混淆矩阵的基本读法、误判样本的整理和归因方法,以及怎样根据误判分析设计改进实验。
文章目录收起
“我的模型准确率是88%。”这是很多AI项目报告里的核心结论。但评委通常会继续问:剩下的12%错在哪里?为什么会错?只报准确率,说明不了模型的真实表现。误判分析能让项目更有深度。
准确率说明不了什么
假设一个识别四类垃圾的模型,测试了100张照片,对了88张。这88%背后可能有很多种情况:
- 四类都错得差不多。
- 某一类几乎全错,其他类全对。
- 两类之间经常互相认错。
不同情况,改进方法完全不同。
用混淆矩阵看错在哪里
混淆矩阵是一张表,行表示真实类别,列表示模型判断的类别:
| 真实\判断 | 可回收物 | 厨余垃圾 | 有害垃圾 | 其他垃圾 |
|---|---|---|---|---|
| 可回收物 | 23 | 0 | 0 | 2 |
| 厨余垃圾 | 0 | 24 | 0 | 1 |
| 有害垃圾 | 1 | 0 | 20 | 4 |
| 其他垃圾 | 3 | 1 | 0 | 21 |
对角线上是判断正确的数量。从这张表可以看出:有害垃圾有4张被认成了其他垃圾,是最主要的错误。
整理误判样本
把所有判断错误的照片单独拿出来,逐张记录:
| 照片 | 真实类别 | 模型判断 | 可能原因 |
|---|---|---|---|
| 017 | 有害垃圾(电池) | 其他垃圾 | 电池很小,背景占了大部分画面 |
| 042 | 有害垃圾(药盒) | 其他垃圾 | 训练集中药盒照片很少 |
| 063 | 其他垃圾(纸巾) | 可回收物 | 纸巾和纸张外观相似 |
给误判归类
整理完后,把原因归成几类,统计每类有多少:
- 物体太小或拍摄距离太远。
- 训练数据中缺少这类物品。
- 两类物品外观相近。
- 光线或背景干扰。
哪类原因最多,就优先针对它改进。
根据分析设计改进实验
例如发现“训练集中缺少小物体的近拍照片”是主要原因,可以:
- 补拍50张电池、药盒等小物体的近距离照片。
- 重新训练模型。
- 用原来的测试集再测一次,比较前后结果。
| 版本 | 总体准确率 | 有害垃圾识别正确数 |
|---|---|---|
| 改进前 | 88% | 20/25 |
| 补充小物体照片后 | 92% | 24/25 |
有针对性的改进,加上前后对比的数据,比单纯“多训练几轮”有说服力得多。
承认模型的局限
有些误判很难通过补充数据解决,比如纸巾和纸张本身就很像,模型只看外观很难区分。在报告中如实写出这些局限,并提出可能的思路,例如结合重量传感器辅助判断,能体现学生对问题的深入思考。
误判分析的过程,其实就是在研究“模型是怎样看世界的”。这部分内容往往是AI项目中最能体现学生自己思考的地方。
资料与编写说明
原创方法文章,诺篮Stem编辑部根据项目指导经验整理
资料核验:2026-10-01从阅读,走到自己的项目
咨询项目方向孩子有想法,却不知从哪里开始?
带上兴趣、年级或已有作品,先聊清楚当前最需要解决的问题。