小白关于决策树的两个疑问
第一个问题,信息增益最大,可以理解为各个子集的信息熵最小,也就是各个子集的不确定性最小,从而使得特征划分更有效,更加准确。
举个例子。如果有数据表明只要今天下雨就不去跑步,今天不下雨就去跑步。那么下雨子集和不下雨子集都确定了跑步的状态,信息熵都是0。显然用是否下雨来划分数据,信息增益最大,效果最好。
【小白关于决策树的两个疑问】 但是是否跑步和早饭吃的是油条还是包子关系不大。 包子子集和油条子集都包含了跑步和不跑步两种状态,不确定性高。显然没有人愿意用早饭特征来划分数据。
第二个问题,也就是数据中出现噪声的情况。如果无法观察到更多的特征来划分数据,那么只能是那种情况多,就认为当前处于哪种情况。只有两个的话……,试试随机选一个?
推荐阅读
- 过节■江苏省委省政府办公厅下发关于做好2021年元旦春节期间有关工作的通知
- |徐州市出台《关于优化创新创业生态系统 提升区域科技创新活力的实施意见》及实施细则
- 雨下|全球关于禁售燃油车只是理论上可行吗
- 关于用phpfsocket 写Post, 模拟http 报文怎样写入要传输的处理数据
- 智叔|很多家长还在整箱买:谈谈关于牛奶的17个真相警惕这些列入黑名单的“假牛奶”
- 关于微信小程序的思考:运营者该何去何从
- 关于人工智能虚拟人的一些问题
- 知乎上关于人生经验的介绍是否可能对青少年造成潜在危害
- 小白选车|中国定制真香定律,朗逸、宝来和凌派尝过甜头,丰田傲澜会成功么
- 写下我关于做数据分析专员的困惑和各位的建议是
