1. 首页
  2. 数据库
  3. 其它
  4. SparkMLlib DecisionTree源码分析

SparkMLlib DecisionTree源码分析

上传者: 2021-02-01 04:17:14上传 PDF文件 136.89KB 热度 8次
以决策树作为开始,因为简单,而且也比较容易用到,当前的boosting或random forest也是常以其为基础的决策树算法本身参考之前的blog,其实就是贪婪算法,每次切分使得数据变得最为有序无序,nodeimpurity对于分类问题,我们可以用熵entropy或Gini来表示信息的无序程度 对于回归问题,我们用方差Variance来表示无序程度,方差越大,说明数据间差异越大用于表示,由父节点划分后得到子节点,所带来的impurity的下降,即有序性的增益下面直接看个regres
用户评论