小白关于决策树的两个疑问

第一个问题,信息增益最大,可以理解为各个子集的信息熵最小,也就是各个子集的不确定性最小,从而使得特征划分更有效,更加准确。
举个例子。如果有数据表明只要今天下雨就不去跑步,今天不下雨就去跑步。那么下雨子集和不下雨子集都确定了跑步的状态,信息熵都是0。显然用是否下雨来划分数据,信息增益最大,效果最好。
【小白关于决策树的两个疑问】 但是是否跑步和早饭吃的是油条还是包子关系不大。 包子子集和油条子集都包含了跑步和不跑步两种状态,不确定性高。显然没有人愿意用早饭特征来划分数据。
第二个问题,也就是数据中出现噪声的情况。如果无法观察到更多的特征来划分数据,那么只能是那种情况多,就认为当前处于哪种情况。只有两个的话……,试试随机选一个?


    推荐阅读