F1Score: 精确率召回率到F1
从混淆矩阵出发,推导精确率和召回率,再通过调和平均得到F1分数。
混淆矩阵
关键部分
混淆矩阵将预测结果分为真正例TP、假正例FP、假负例FN、真负例TN四类,是分类评估的基础。
分类评估指标
使用 NumPy 实现准确率、精确率、召回率、F1 等指标。
📌 混淆矩阵与基本指标:从混淆矩阵计算 Accuracy、Precision、Recall、F1。
分类评估指标对比:Accuracy vs Precision vs Recall vs F1 vs AUC
不同分类指标从不同角度评估模型性能,适用于不同的业务场景。
| 对比项 | Accuracy | Precision | Recall | F1 | AUC |
|---|---|---|---|---|---|
| 评估角度 | 整体正确率 | 预测为正的准确率 | 真实正例的覆盖率 | 精确与召回的调和 | 不同阈值下的区分能力 |
| 对类别不平衡敏感 | 是 | 否 | 否 | 否⭐ | 否 |
| 需要阈值 | 是 | 是 | 是 | 是 | 否(基于概率)⭐ |
| 取值范围 | [0, 1] | [0, 1] | [0, 1] | [0, 1] | [0.5, 1] |
| 关注正类 | 否 | 是 | 是 | 是 | 是 |
| 适用场景 | 类别均衡 | 误报代价高 | 漏报代价高 | 需平衡P/R | 模型整体排序能力 |
| 多分类支持 | 直接 | 需宏/微平均 | 需宏/微平均 | 需宏/微平均 | 需OvR扩展 |
| 推荐度 | 有限 | 视场景 | 视场景 | 常用 | 首选⭐ |
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
"准确率悖论":在99:1的不平衡数据上,模型只要全猜"多数类"就有99%准确率——但这毫无意义。这就是为什么需要精确率、召回率、F1、AUC等指标,它们从不同角度揭示模型的真实表现。
分类指标包括准确率、精确率、召回率、F1值和AUC等,从不同角度评估分类器性能。
这些坑别踩
误区 1
准确率是评估分类模型最好的指标。
正确理解
准确率在类别不平衡时会误导(如99%负样本时全预测负类准确率99%),应结合精确率、召回率、F1或AUC综合评估。
误区 2
精确率和召回率总是越高越好且可以同时达到。
正确理解
精确率和召回率通常存在权衡关系,提高一个往往降低另一个,需根据业务场景选择侧重点或用F1综合。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
在类别极度不平衡的数据集中,下列哪个指标最不适合单独用来评估模型?
精确率(Precision)和召回率(Recall)的定义分别是?
关于 AUC-ROC,下列说法正确的是?
F1 分数是精确率和召回率的什么组合?
面试经典题
共 4 题 · 先思考再看答案
请解释准确率、精确率、召回率、F1 分数的含义及适用场景。
什么是 ROC 曲线和 AUC?AUC 的概率含义是什么?
在什么情况下应该优先使用 PR 曲线而非 ROC 曲线?
请说明 F-beta 分数的含义,以及如何根据业务选择 beta。
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺