惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

阮一峰的网络日志
阮一峰的网络日志
J
Java Code Geeks
Martin Fowler
Martin Fowler
宝玉的分享
宝玉的分享
V
Visual Studio Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
M
MIT News - Artificial intelligence
U
Unit 42
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
The GitHub Blog
The GitHub Blog
I
InfoQ
WordPress大学
WordPress大学
H
Help Net Security
D
Docker
B
Blog
腾讯CDC
A
About on SuperTechFans
Recent Announcements
Recent Announcements
雷峰网
雷峰网
有赞技术团队
有赞技术团队
C
Check Point Blog
Y
Y Combinator Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
决策树与随机森林算法:可视化的决策过程
AI小当家 · 2024-01-25 · via 人人都是产品经理

决策树既可以计算出结果,还能够清晰地告诉我们得到这个结果的原因。那么在决策中,可以如何应用决策树与随机森林算法?本文对此进行了解析,一起来看看吧。

上篇文章我们介绍了逻辑回归算法,今天我们接着来学习另一个基础的分类和回归方法,决策树。

决策树既可以输出计算结果,还能很清楚的告诉我们为什么会得到这个结果。

如果对一棵决策树的效果不够满意,还可以使用多棵决策树来协同解决问题,这就是随机森林,属于集成学习的一种。

而随机森林这样的集成学习算法,融合了多个模型的优点,所以在遇到分类问题的场景时,决策树和随机森林常被当做机器学习的首选算法。

一、初识决策树

举个栗子,我们要判断一个物体是否属于鸟类,一般会看它是否会飞、是否有羽毛等条件,如果它既会飞又有羽毛,那么大概率就是鸟类了。

我整理了几条样本数据,如下表所示:

基于表格里的数据,我们可以根据每个条件的结果,画出如下的决策树:

如上图所示,决策树(Decision Tree)就是一种树形结构的算法,每个节点对应了算法的一个特征(是否会飞等),节点上的每一个分支(会飞、不会飞)对应了特征的不同种类,最后绿色的叶子节点对应了最终决策结果(是否鸟类)

有了这个决策树之后,再有新的数据进来,沿着决策树自上而下的走一圈,就能得到决策结果,而且决策过程清晰明了。

二、信息熵

仔细观察上图的决策树,我们可以发现,不同的决策条件会导致其得到的子节点数据是完全不同的,从而得到完全不同的决策树结构,那么我们如何快速找到最优的决策条件,使决策树的效率和准确率更高呢?

这里需要引入信息熵的概念了:信息熵(Entropy)是衡量一个节点内不确定性的度量

怎么理解呢?我们对刚才的决策树做一些改变,只保留两层节点,去掉“是否有羽毛”条件,如下图所示。那么最终的黄色叶子节点里,就会同时存在是鸟类和不是鸟类的样本数据,这个节点的不确定性就增加了,也就是信息熵变高了。

我们肯定希望决策树每次划分的时候,最终的叶子节点信息熵更低,这样每个叶子节点内的样本纯度也就越高,最终生成的决策树的确定性更强,效率会更高。

在构建决策树的时候,一般通过信息熵来筛选出更重要的特征,并把更重要的特征放到更靠前的节点上去。

三、如何生成决策树?

生成决策树包括特征选择、决策树生成、决策树剪枝等三个步骤。

在特征选择和决策树生成阶段,最重要的任务就是通过信息熵来筛选出更重要的特征,并把更重要的特征放到更靠前的节点上去。

决策树会评估每一个特征划分后系统的“信息熵指标”,“信息熵指标”最低的特征越靠近根节点,这样一来,决策树的复杂度和计算时间就会减少,模型就会更高效。

不同的决策树算法,所谓的“信息熵指标”也不一样,比如ID3算法使用的是信息增益,C4.5算法使用的是信息增益率,目前使用较多的CART算法使用的是Gini系数,这里不再赘述,感兴趣的话可以自己查一下相关资料。

上图的决策树,根据“信息熵指标”优化后的结果如下:

由于决策树很容易出现过拟合的现象,我们还需要对决策树进行剪枝操作。

剪枝操作可以降低决策树的复杂性,提升模型的泛化能力,基本原理就是判断把某节点去掉之后,模型准确度是否大幅下降,如果没有下降,就可以剪掉这个节点。

比如优化后的决策树,把是否是动物节点去掉后,并不影响模型的准确度,那就可以对其做剪枝处理,从而得到新的决策树。

四、应用场景

决策树的可解释性非常高,可以很容易的解释清楚其计算逻辑,所以适合各种需要强解释性的应用场景,比如咨询、金融等领域。

  • 金融领域:决策树可以用于信用评分、风险评估、欺诈检测等金融领域的问题。
  • 医疗诊断:决策树可以用于医疗诊断,如疾病诊断、药物选择等。
  • 市场营销:决策树可以用于市场营销中的用户分类、客户细分等问题。
  • 生物医学领域:决策树可以用于基因表达数据分析、蛋白质结构预测等生物医学领域的问题。
  • 电子商务:决策树可以用于推荐系统、用户行为分析等电子商务领域的问题。

五、优缺点

决策树的优点:

  • 可解释性强:决策树的生成过程可以直观地表示为一棵树形结构,易于理解和解释。每个节点代表一个特征,每个分支代表一个特征取值,叶子节点代表一个类别或一个决策结果。
  • 适用性广泛:决策树可以用于分类和回归任务,可以处理离散型和连续型特征,也可以处理多分类和多输出问题。
  • 数据预处理简单:决策树对于缺失值和异常值具有较好的容忍性,不需要对数据进行严格的预处理。
  • 特征选择自动化:决策树可以自动选择最重要的特征进行分裂,能够处理高维数据和特征选择问题。
  • 处理非线性关系:决策树可以处理非线性关系,不需要对数据进行线性化处理。

决策树的缺点:

  • 容易过拟合:决策树容易过度拟合训练数据,特别是当树的深度较大或训练样本较少时。过拟合会导致模型在新数据上的泛化能力较差。
  • 不稳定性:决策树对于数据的微小变化非常敏感,即使数据发生轻微的变化,生成的决策树可能完全不同。
  • 忽略特征间的相关性:决策树在生成过程中只考虑了单个特征的重要性,忽略了特征之间的相关性。这可能导致决策树在处理某些问题时效果不佳。
  • 难以处理连续型特征:决策树对于连续型特征的处理相对困难,需要进行离散化或采用其他方法进行处理。
  • 生成过程不稳定:决策树的生成过程是基于启发式算法的,不同的启发式算法可能生成不同的决策树,导致结果的不稳定性。

六、随机森林:三个臭皮匠,赛过诸葛亮

单棵决策树容易出现过拟合的情况,并且结果也较不稳定,这时候我们可以使用多棵决策树来共同解决问题,这就是就是随机森林。

随机森林(Random Forest)是一种集成学习方法,通过组合多个决策树来进行分类或回归任务

每棵决策树都随机抽取不同的样本进行训练,我们会得到三个不同的决策树,再综合考虑三棵树的决策结果,就能得到最终的决策结果了。

由于是根据多个决策树的结果共同决策,所以随机森林具有“起点高、上限低”的特点。

与单棵决策树相比,随机森林具有以下优点:

  • 高准确性:随机森林通过集成多个决策树的预测结果,可以获得更准确的分类或回归结果。
  • 可处理大规模数据:随机森林可以并行生成多棵决策树,因此在处理大规模数据时具有较高的计算效率。
  • 不容易过拟合:随机森林引入了随机性,通过随机选择样本和特征子集来生成决策树,减少了过拟合的风险。

相应的,随机森林也有以下缺点:

  • 计算复杂度高:随机森林需要生成多棵决策树,并且每棵决策树都需要考虑随机选择的样本和特征子集,因此计算复杂度较高。
  • 可解释性相对较差:随机森林生成的模型是一个集成模型,由多棵决策树组成,因此模型的解释性较差,不如单棵决策树直观。

七、总结

本文我们介绍了决策树和随机森林的原理、应用场景和优缺点,同时决策树也有升级版本,比如XGBoost等,可以自己查一下。

下篇文章,我们来聊一聊支持向量机算法,敬请期待。

本文由 @AI小当家 原创发布于人人都是产品经理,未经许可,禁止转载

题图来自 Unsplash,基于 CC0 协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。