您当前的位置:首页 > 电脑百科 > 人工智能

混淆矩阵-不再那么令人混淆了

时间:2020-06-18 10:36:11  来源:  作者:

机器学习基础,了解混淆矩阵的所有方面

在本文中,我们将重点了解混淆矩阵和使用混淆矩阵(I类错误,II类错误和准确度)计算的指标。 在分类算法的情况下使用此方法来确定/评估模型的性能。

混淆矩阵-不再那么令人混淆了

 

我们从建立数据集开始,同时建立任何统计或ML模型。 将该数据集分为两部分:培训和测试。 保留测试数据集,并使用训练数据集训练模型。 一旦模型准备好进行预测,我们就尝试对测试数据集进行预测。 一旦将结果分割成类似于上图所示的矩阵,就可以看到我们的模型能够预测正确的数量以及其预测错误的数量。

混淆矩阵-不再那么令人混淆了

 

我们使用测试数据集中的数字填充上图中所示的4个单元格(例如,具有1000个观察值)。

· TP(真阳性):在测试数据集中该列的实际标签为"是",而我们的逻辑回归模型也预测为"是"。 (500观察)

· TN(真阴性):在测试数据集中该列的实际标签为"否",而我们的逻辑回归模型也预测为"否"。 (200观察)

· FP(假阳性):在测试数据集中该列的实际标签为"否",但我们的逻辑回归模型预测为"是"。 (100观察)

· FN(假阴性):在测试数据集中该列的实际标签为"是",但我们的逻辑回归模型预测为"否"。 (200观察)

这4个单元格构成了"混淆矩阵",就像矩阵一样,它可以通过清晰地描绘模型的预测能力来减轻对模型优劣的所有混淆。

混淆矩阵是一个表,通常用于描述分类模型(或"分类器")对一组已知真实值的测试数据的性能。

关于混淆矩阵可以理解的其他指标

类型I错误

混淆矩阵-不再那么令人混淆了

 

类型1错误也称为误报,当分类模型错误地为最初的错误观察结果预测真实结果时发生。

例如:假设我们的物流模型正在处理垃圾邮件而非垃圾邮件电子邮件用例。 如果我们的模型将原本很重要的电子邮件标记为垃圾邮件,那么这就是我们的模型I型错误的示例。 在这个特殊的问题陈述中,我们很敏感地尽可能地减少Type I错误,因为进入垃圾邮件的重要电子邮件可能会造成严重后果。

3. II型错误

混淆矩阵-不再那么令人混淆了

 

II型错误也称为假阴性,当分类模型错误地为原始真实观察结果预测错误结果时,就会发生II型错误。

例如:假设我们的逻辑模型正在处理一个用例,它必须预测一个人是否患有癌症。 如果我们的模型将患有癌症的人标记为健康人并将其分类错误,则这就是我们的模型发生的II型错误的例子。 在这个特殊的问题陈述中,我们对尽可能减少II型错误非常敏感,因为在这种情况下,如果假阴性继续影响患者,则假阴性可能导致死亡。

4.准确性

现在,以上讨论的三个指标都是通用指标,与您拥有的培训和测试数据的种类以及为问题陈述所部署的分类算法的种类无关。

我们现在正着手讨论非常适合特定类型数据的指标。

让我们从这里开始谈论准确性,这是最适合平衡数据集的指标。 请参考下图,该图源于本文。

混淆矩阵-不再那么令人混淆了

> Source: Link

 

如您所见,平衡数据集是一个由训练数据平均代表1和0,是和否,正负的数据集。 另一方面,如果两个类别标签的比率出现偏差,则我们的模型将偏向一个类别。

假设我们有一个平衡的数据集,让我们学习什么是准确性。

混淆矩阵-不再那么令人混淆了

 

精度是测量结果与真实值的接近程度。 它告诉我们分类模型能够多么准确地预测问题陈述中给出的类别标签。

例如:假设我们的分类模型正在尝试预测客户流失情况。 在上图中,在总共700个实际损耗的客户(TP + FN)中,该模型正确地能够正确分类500个损耗的客户(TP)。 同样,在300个保留客户(FP + TN)中,该模型正确地能够正确分类200个保留客户(TN)。

准确度=(TP + TN)/总客户

在上述情况下,我们看到该模型在1000个客户的测试数据集上的准确性为70%。

现在,我们了解到精度是仅应用于平衡数据集的指标。 为什么会这样? 让我们看一个例子来理解这一点。

混淆矩阵-不再那么令人混淆了

 

在此示例中,该模型是在不平衡数据集上训练的,甚至测试数据集也是不平衡的。 准确度指标的得分为72%,这可能使我们觉得我们的模型在分类方面做得很好。 但是,仔细观察,此模型在预测否定类标签方面做得很糟糕。 它仅预测了100个阴性标记观察结果中的20个正确结果。 因此,如果数据集不平衡,则不应该使用"准确性"度量标准。

这篇文章专注于完整地理解混乱矩阵。

如果您想了解有关可用于评估分类模型的其他指标的更多信息,例如召回率,精度,AUC-ROC等,则可以参考我下面有关该主题的详尽文章。

分类ML模型的十大模型评估指标

非常规地解释,这将作为评估分类机器学习模型的详尽清单。

请继续关注此空间,以获取有关数据科学,机器学习和统计的更多信息!

快乐学习:)

(本文翻译自Juhi Ramzai的文章《Confusion Matrix- Not so confusing anymore!》,参考:
https://towardsdatascience.com/confusion-matrix-not-so-confusing-anymore-3b7a934d623c)



Tags:混淆矩阵   点击:()  评论:()
声明:本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,如有任何标注错误或版权侵犯请与我们联系(Email:2595517585@qq.com),我们将及时更正、删除,谢谢。
▌相关推荐
机器学习基础,了解混淆矩阵的所有方面在本文中,我们将重点了解混淆矩阵和使用混淆矩阵(I类错误,II类错误和准确度)计算的指标。 在分类算法的情况下使用此方法来确定/评估模型的...【详细内容】
2020-06-18  Tags: 混淆矩阵  点击:(108)  评论:(0)  加入收藏
▌简易百科推荐
作为数据科学家或机器学习从业者,将可解释性集成到机器学习模型中可以帮助决策者和其他利益相关者有更多的可见性并可以让他们理解模型输出决策的解释。在本文中,我将介绍两个...【详细内容】
2021-12-17  deephub    Tags:AI   点击:(16)  评论:(0)  加入收藏
基于算法的业务或者说AI的应用在这几年发展得很快。但是,在实际应用的场景中,我们经常会遇到一些非常奇怪的偏差现象。例如,Facebook将黑人标记为灵长类动物、城市图像识别系统...【详细内容】
2021-11-08  数据学习DataLearner    Tags:机器学习   点击:(32)  评论:(0)  加入收藏
11月2日召开的世界顶尖科学家数字未来论坛上,2013年诺贝尔化学奖得主迈克尔·莱维特、2014年诺贝尔生理学或医学奖得主爱德华·莫索尔、2007年图灵奖得主约瑟夫·斯发斯基、1986年图灵奖得主约翰·霍普克罗夫特、2002...【详细内容】
2021-11-03  张淑贤  证券时报  Tags:人工智能   点击:(39)  评论:(0)  加入收藏
鉴于物联网设备广泛部署、5G快速无线技术闪亮登场,把计算、存储和分析放在靠近数据生成的地方来处理,让边缘计算有了用武之地。 边缘计算正在改变全球数百万个设备处理和传输...【详细内容】
2021-10-26    计算机世界  Tags:边缘计算   点击:(45)  评论:(0)  加入收藏
这是几位机器学习权威专家汇总的725个机器学习术语表,非常全面了,值得收藏! 英文术语 中文翻译 0-1 Loss Function 0-1损失函数 Accept-Reject Samplin...【详细内容】
2021-10-21  Python部落    Tags:机器学习   点击:(43)  评论:(0)  加入收藏
要开始为开源项目做贡献,有一些先决条件:1. 学习一门编程语言:由于在开源贡献中你需要编写代码才能参与开发,你需要学习任意一门编程语言。根据项目的需要,在后期学习另一种语言...【详细内容】
2021-10-20  TSINGSEE青犀视频    Tags:机器学习   点击:(37)  评论:(0)  加入收藏
SimpleAI.人工智能、机器学习、深度学习还是遥不可及?来这里看看吧~ 从基本的概念、原理、公式,到用生动形象的例子去理解,到动手做实验去感知,到著名案例的学习,到用所学来实现...【详细内容】
2021-10-19  憨昊昊    Tags:神经网络   点击:(47)  评论:(0)  加入收藏
语言是人类思维的基础,当计算机具备了处理自然语言的能力,才具有真正智能的想象。自然语言处理(Natural Language Processing, NLP)作为人工智能(Artificial Intelligence, AI)的核心技术之一,是用计算机来处理、理解以及运...【详细内容】
2021-10-11    36氪  Tags:NLP   点击:(49)  评论:(0)  加入收藏
边缘计算是什么?近年来,物联网设备数量呈线性增长趋势。根据艾瑞测算, 2020年,中国物联网设备的数量达74亿,预计2025年突破150亿个。同时,设备本身也变得越来越智能化,AI与互联网在...【详细内容】
2021-09-22  汉智兴科技    Tags:   点击:(54)  评论:(0)  加入收藏
说起人工智能,大家总把它和科幻电影中的机器人联系起来,而实际上这些科幻场景与现如今的人工智能没什么太大关系。人工智能确实跟人类大脑很相似,但它们的显著差异在于人工智能...【详细内容】
2021-09-17  异步社区    Tags:人工智能   点击:(57)  评论:(0)  加入收藏
相关文章
    无相关信息
最新更新
栏目热门
栏目头条