FEATURED · 精选文章

机器学习-决策树

发布时间 / 2026/8/5 8:28:32
来源 / 创域科博编辑部
栏目 / 资讯中心
机器学习-决策树 概念决策树通过对训练样本的学习建立分类规则然后依据分类规则对新样本数据进行分类预测属于有监督学习。核心所有数据从根节点逐步落到叶子节点。决策树主要有三种算法ID3 算法、C4.5 算法、CART 决策树我们首先学习 ID3 算法。衡量标准熵值表示随机变量不确定性的度量或者说是系统内部的混乱程度。熵值计算公式A 集合[1, 1, 1, 1, 1, 1, 1, 1, 2, 2] B 集合[0, 1, 2, 3, 4, 5, 6, 7, 8, 9]A 集合熵值\(-2/10*\log_2(2/10)-8/10*\log_2(8/10) 0.722\)B 集合熵值\(-1/10*\log_2(1/10)*10 3.322\)显然 B 的熵值更大更加混乱。决策树无限制生长时会学习训练集里的噪声和特例对训练数据预测效果极好但对未见过的测试数据预测效果很差。剪枝通过简化树结构来提升模型泛化能力。为了防止过拟合我们通常会对决策树进行剪枝决策树剪枝分为预剪枝与后剪枝我们先学习预剪枝。预剪枝的常见策略包括限制树的深度限制叶子节点的个数以及叶子节点的样本数基尼系数方式核心思想优缺点预剪枝树构建过程中提前停止分裂还没长成完整树训练速度快容易欠拟合后剪枝先生成完整决策树自底向上删除多余分支效果通常更好训练耗时更高代码示例读取 Excel 文件data 取所有信息除了最后一行target 取最后一行为训练做准备datas pd.read_excel(电信客户流失数据2.xlsx) data datas.iloc[:,:-1] target datas.iloc[:,-1]划分训练集和测试集from sklearn.model_selection import train_test_split data_train, data_test, target_train, target_test train_test_split(data, target, test_size0.2, random_state0)对决策树进行预剪枝criterion 为分裂标准max_depth 为最大深度min_samples_leaf 为叶节点最少样本数并进行训练from sklearn import tree dtr tree.DecisionTreeClassifier( criteriongini, max_depth15, min_samples_leaf5, random_state0 ) dtr.fit(data_train, target_train)以下是训练集和测试集的评估报告train_predicted dtr.predict(data_train) from sklearn import metrics print(metrics.classification_report(target_train, train_predicted)) cm_plot(target_train, train_predicted).show()test_predicted dtr.predict(data_test) from sklearn import metrics print(metrics.classification_report(target_test, test_predicted)) cm_plot(target_test, test_predicted).show() dtr.score(data_test, target_test)import matplotlib.pyplot as plt from sklearn.tree import plot_tree fig, ax plt.subplots(figsize(32, 32)) plot_tree(dtr, filledTrue, axax) plt.show()输出为precision recall f1-score support 0 0.91 0.93 0.92 357 1 0.78 0.74 0.76 123 accuracy 0.88 480 macro avg 0.85 0.83 0.84 480 weighted avg 0.88 0.88 0.88 480 precision recall f1-score support 0 0.90 0.81 0.85 89 1 0.57 0.74 0.65 31 accuracy 0.79 120 macro avg 0.74 0.78 0.75 120 weighted avg 0.82 0.79 0.80 120决策树回归import pandas as pd from sklearn import tree datas pd.read_csv(r多元回归.csv, encodinggbk) datad_X datas[[体重, 年龄]] data_y datas[血压收缩] dtr tree.DecisionTreeRegressor(random_state0) # 与决策树分类不同在这里 dtr.fit(datad_X, data_y) score dtr.score(datad_X, data_y) print(data_y) print(score)输出为0 120 1 141 2 124 3 126 4 117 5 125 6 123 7 125 8 132 9 123 10 132 11 155 12 147 Name: 血压收缩, dtype: int64 1.0
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻