john_bh

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法

C**转载请注明作者和出处：**http://blog.csdn.net/john_bh/
运行平台： Windows
Python版本： Python2.7
IDE： Sublime text3

一决策树的概述
- 1 决策树的发展
- 2 决策树的定义
- 3 决策树与if-then规则
二决策树的算法框架
- 1 决策树主函数
- 2 计算最优特征子函数
- 3 划分数据集子函数
- 4 分类器
三决策树的构造
- 1 特征选择
  - 11 信息增益information gain
  - 12 信息增益的算法
  - 13 信息增益比
  - 14 实例
  - 15 代码实现
- 2 决策树的生成
  - 21 ID3算法
  - 22 C45算法
  - 23 编写代码构建决策树
- 3 决策树的修剪
- 4 CART算法
  - 41 CART生成
    - 411 回归树的生成
    - 412 分类树的生成
  - 42 CART剪枝

一、决策树的概述

1.1 决策树的发展

决策树算法是最早的机器学习算法之一，在1966年，Hunt、Marin和Stone提出的CLS学习系统就有了决策树的算法的概念。但是直到1979年，J.R.Quinlan才给出了ID3算法的原型。1983年和1986年，他对ID3进行了总结和简化，正式确立了决策树学习的理论。从机器学习的角度来看，这是决策树算法的起点。
1986年，Schimmer和Fisher在此基础上进行改造，引入了节点缓冲区，提出了ID4算法。
1993年，Quinlan进一步发展ID3算法，改进成了C4.5算法，成为机器学的十大算法之一。
ID3的另一个分支是分类回归决策树算法（Classification and Regression Tree，CART）。与C4.5不同的是，CART的决策树主要用于预测，这样决策树理论完整的覆盖了机器学习中的分类和回归两个领域。
k-近邻算法，可以很多分类任务，但是他最大的缺点是无法给出数据的内在含义，而决策树的主要优势就在于数据形式非常容易理解。

1.2 决策树的定义

决策树是什么？决策树(decision tree)是一种基本的分类与回归方法。分类决策树模型是一种描述对实例进行分类的树形结构。决策树由结点(node)和有向边(directed edge)组成。结点有两种类型：内部结点(internal node)和叶结点(leaf node)。内部结点表示一个特征或属性，叶结点表示一个类。举个通俗易懂的例子，如图 1.1所示的流程图就是一个决策树，长方形代表判断模块(decision block)，椭圆形成代表终止模块(terminating block)，表示已经得出结论，可以终止运行。从判断模块引出的左右箭头称作为分支(branch)，它可以达到另一个判断模块或者终止模块。长方形和椭圆形都是结点。长方形的结点属于内部结点，椭圆形的结点属于叶结点，从结点引出的左右箭头就是有向边。而最上面的结点就是决策树的根结点(root node)。

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第1张图片

图 1.1流程图形式的决策树

1.3 决策树与if-then规则

我们可以把决策树看成一个if-then规则的集合，其中if是条件，then就是选择或决策。
将决策树转换成if-then规则的过程：由决策树的根结点(root node)到叶结点(leaf node)的每一条路径构建一条规则；路径上内部结点的特征对应着规则的条件，而叶结点的类对应着规则的结论。决策树的路径或其对应的if-then规则集合具有一个重要的性质：互斥并且完备。这就是说，每一个实例都被一条路径或一条规则所覆盖，而且只被一条路径或一条规则所覆盖。这里所覆盖是指实例的特征与路径上的特征一致或实例满足规则的条件。

决策树的一般流程：

收集数据：可以使用任何方法；比如想构建一个相亲系统，我们可以从媒婆那里，或者通过参访相亲对象获取数据。根据他们考虑的因素和最终的选择结果，就可以得到一些供我们利用的数据了。
准备数据：收集完的数据，我们要进行整理，将这些所有收集的信息按照一定规则整理出来，并排版，方便我们进行后续处理。使用ID3树构造算法无法处理数值型数据，因此数值型数据必须离散化，转换成标称型数据。
分析数据：可以使用任何方法，决策树构造完成之后，我们可以检查决策树图形是否符合预期。
训练算法：这个过程也就是构造决策树，同样也可以说是决策树学习，就是构造一个决策树的数据结构。
测试算法：使用经验树计算错误率。当错误率达到了可接收范围，这个决策树就可以投放使用了。
使用算法：此步骤可以使用适用于任何监督学习算法，而使用决策树可以更好地理解数据的内在含义。

决策树的优点：

计算复杂度不高；
输出结果易于理解；
对中间值得缺失不敏感；
可以处理不相关特征数据；

决策树的缺点：

可能会产生过度匹配的问题
处理连续变量不好
类别较多时，错误增加的比较快
可规模性一般

适用数据类型：数值型和标称型

二、决策树的算法框架

2.1 决策树主函数

各种决策树的主函数都大同小异，本质上是一个递归函数。该函数的主要功能是按照某种规则生长出决策树的各个分支接点，并根据终止条件结束算法。一般来说主函数需要完成如下几个功能：

输入需要分类的数据集和分类标签；
根据某种分类规则的到最优的划分特征，并创建特征的划分节点—计算最优特征子函数；
按照特征的每个取值划分数据集为若干个部分—划分数据集子函数；
根据划分子函数的计算结果构建出新的节点，作为树生长出的新分支；
检验是否符合递归的终止条件；
将划分的新节点包含的数据集和类别标签作为输入，递归执行上述步骤

2.2 计算最优特征子函数

计算最优特征子函数是除了主函数外最重要的函数。每种决策树之所以不同，一般都是因为最优特征选择的标准上有所差异，不用的标准导致不同类型的决策树，例如：ID3的最优特征先择标准是信息增益、C4.5的是信息增益率、CART的是节点方差的大小等。
在算法逻辑上，一般选择最优特征需要遍历整个数据集，评估每个特征，找到最优的那个特征返回。

2.3 划分数据集子函数

划分数据集函数的主要功能是分隔数据集，有需要删除某个特征轴所在的数据列，返回剩余的数据集，有的干脆将数据集一分为二，虽然实现有所不同，但是含义基本都是一致的。

2.4 分类器

所有的机器学习算法都要用于分类或回归预测。决策树的分类器就是通过遍历整个决策树，使测试数据集找到决策树中叶子结点对应的类别标签。这个标签就是返回的结果。

三、决策树的构造

决策树要如何构建呢？通常，这一过程可以概括为3个步骤：特征选择、决策树的生成和决策树的修剪。

3.1 特征选择

特征选择在于选取时对训练数据具有分类能力的特征。这样可以提高决策树的学习效率，如果利用一个特征进行分类的结果与随机分类的结果没有很大差别，则成这个特征是没有分类能力的。经验上扔掉这样的特征对决策树学习的精度影响不大。通常特征选择的标准是信息增益或信息增益比。
表3.1 贷款申请样本数据：

ID	年龄	有工作	有自己的房子	信贷情况	类别（是否给贷款）
1	青年	否	否	一般	否
2	青年	否	否	好	否
3	青年	是	否	好	是
4	青年	是	是	一般	是
5	青年	否	否	一般	否
6	中年	否	否	一般	否
7	中年	否	否	好	否
8	中年	是	是	好	是
9	中年	否	是	非常好	是
10	中年	否	是	非常好	是
11	老年	否	是	非常好	是
12	老年	否	否	好	是
13	老年	是	是	好	是
14	老年	是	否	非常好	是
15	老年	否	否	一般	否

希望通过所给的训练数据学习一个贷款申请的决策树，用以对未来的贷款申请进行分类，即当新的客户提出贷款申请时，根据申请人的特征利用决策树决定是否批准贷款申请。
特征选择就是决定用哪个特征来划分特征空间。

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第2张图片

图3.1

图3.1 表示从表3.1 数据学习到得两个可能的决策树，分别由两个不同特征值的根节点构成。图1所示的根结点的特征是年龄，有3个取值，对应于不同的取值有不同的子结点。图2所示的根节点的特征是工作，有2个取值，对应于不同的取值有不同的子结点。两个决策树都可以从此延续下去。问题是：究竟选择哪个特征更好些？这就要求确定选择特征的准则。直观上，如果一个特征具有更好的分类能力，或者说，按照这一特征将训练数据集分割成子集，使得各个子集在当前条件下有最好的分类，那么就更应该选择这个特征。信息增益就能够很好地表示这一直观的准则。

3.1.1 信息增益(information gain)

划分数据集的大原则是：将无序的数据变得更加有序。组织杂乱无章数据的一种方法就是使用信息论量化度量信息，信息论是量化处理信息的分支学科，我们可以在划分数据之前或之后使用信息论量化度量信息的内容。
在划分数据集之前之后信息发生的变化成为信息增益。知道如何计算信息增益，我们可以计算每个特征值划分数据集获得的信息增益，获得信息增益最高的特征就是最好的选择。
熵（entropy）：
集合信息的度量方式称为香农熵或者简称熵，这个名字来源于信息论之父克劳德·香农。熵定义为信息的期望值。在信息论与概率统计中，熵是表示随机变量不确定性的度量。如果待分类的事务可能划分在多个分类之中，则符号 xi 的信息定义为

l (x i) = - l o g 2 p (x i)

其中

p(xi) 是选择该分类的概率。
通过上式，我们可以得到所有类别的信息。为了计算熵。我们需要计算所有类别所有可能值包含的信息期望值，通过下面的公式得到：

H = - \sum i = 1 n p (x i) l o g 2 p (x i)

期中n是分类的数目。熵越大，随机变量的不确定性就越大。
条件熵(conditional entropy)：
设有随机变量（X,Y）,其联合概率分布为：

P (X = x i, Y = y j) = p i j ； 其 中 i = 1, 2, . . ., n; j = 1, 2, . . ., m;

条件熵H(Y|X)表示已知随机变量X的条件下随机变量Y的不确定性，随机变量X给定的条件下随机变量Y的条件熵（conditional entropy）H(Y|X),定义为X给定条件下的Y的条件概率分布的熵对X的数学期望：

H (Y | X) = \sum i = 1 n p i H (Y | X = x i)

这里，

pi=P(X=xi),i=1,2,...,n
当熵和条件熵中的概率由数据估计（特别是极大似然估计）得到时，所对应的熵与条件熵成为经验熵(empirical entropy）和经验条件熵(empirical conditional entropy）.
信息增益(information gain)表示得知特征X的信息而使得类Y的信息的不确定性减少的程度。

3.1.2 信息增益的算法

设训练数据集D，|D|表示其样本容量，即样本个数。设有K个类 Ck ，k = 1,2,3,···,K， |Ck| 为属于类 Ck 的样本个数， ∑Kk=1|Ck|=|D| 。

设特征A有n个不同的取值{ a1,a2,...,an }，根据特征A的取值将D划分为n个子集 D1,D2,...,Dn , |Di| 为 Di 的样本个数， ∑ni=1|Di|=|D| 。记子集 Di 中属于类 Ck 的样本的集合为 Dik ，即 Dik=Di⋂Ck，|Dik|为Dik 的样本个数。

输入：训练数据集D和特征A:
输出：特征A对训练数据集D的信息增益g(D,A)。
1)计算数据D的经验熵H(D):

H (D) = - \sum k = 1 K | C k | | D | log 2 | C k | | D |

2)计算特征A对训练数据集D的经验条件熵H(D|A):

H (D | A) = \sum i = 1 n | D i | | D | H (D i) = - \sum i = 1 n | D i | | D | \sum k = 1 K | D i k | | D i | log 2 | D i k | | D i |

3)计算信息增益：

g (D, A) = H (D) - H (D | A)

3.1.3 信息增益比：

以信息增益作为划分训练数据集的特征，存在偏向于选择取值较多的特征的问题。使用信息增益比（information gain ratio）可以对这一问题进行校正，这是特征选择的另一准则。
信息增益比算法的定义：
特征A对训练数据集D的信息增益比 gR(D,A) 定义为其信息增益 g(D,A) 与训练数据集D关于特征A的值得熵 HA(D) 之比，即

g R (D, A) = g ( D , A ) H A ( D )

其中，

HA(D)=−∑ni=1|Di||D|log2|Di||D| ，n是特征A取值的个数。

3.1.4 实例：

对表3.1所给的训练数据集D，根据信息增益准则选择最优特征：
首先计算经验熵，根据公式计算经验熵H(D)，分析样本数据表中的数据。最终分类结果只有两类，即放贷和不放贷。根据表中的数据统计可知，在15个数据中，9个数据的结果为放贷，6个数据的结果为不放贷。所以数据集D的经验熵H(D)为：

H (D) = - 9 15 log 2 9 15 - 6 15 log 2 6 15 = 0.971

然后计算各特征对数据集D的信息增益，分别以

A1,A2,A3,A4 表示年龄、有工作、有自己的房子和信贷情况4个特征。
1)年龄这一列的数据，也就是特征

A1 ，一共有三个类别，分别是：青年、中年和老年。年龄是青年的数据一共有5个，所以年龄是青年的数据在训练数据集出现的概率是十五分之五，也就是三分之一。同理，年龄是中年和老年的数据在训练数据集出现的概率也都是三分之一。年龄是青年的数据的最终得到贷款的概率为五分之二，因为在五个数据中，只有两个数据显示拿到了最终的贷款，同理，年龄是中年和老年的数据最终得到贷款的概率分别为五分之三、五分之四。所以计算年龄的信息增益，过程如下:

g (D ， A 1) = H (D) - [5 15 H (D 1) + 5 15 H (D 2) + 5 15 H (D 3)] = 0.971 - [5 15 (- 2 5 log 2 2 5 - 3 5 log 2 3 5) + 5 15 (- 3 5 log 2 3 5 - 2 5 log 2 2 5) + 5 15 (- 4 5 log 2 4 5 - 1 5 log 2 1 5)] = 0.971 - 0.888 = 0.083

2)有工作，特征 A2 ，一共有两个类别，分别是：是、否。有工作为是的数据，一共有5个，所以有工作为是的数据在训练数据集出现的概率是十五分之五，也就是三分之一。则有工作为否的数据在训练数据集出现的概率是十五分之十，也就是三分之二。有工作为是的数据的最终得到贷款的概率为一，因为在五个数据中，全部拿到了最终的贷款，同理，有工作为否的数据最终得到贷款的概率为十分之四。所以计算有工作的信息增益，过程如下：

g (D ， A 2) = H (D) - [5 15 H (D 1) + 10 15 H (D 2)] = 0.971 - [5 15 \times 0 + 10 15 (- 4 10 log 2 4 10 - 6 10 log 2 6 10)] = 0.324

3)有自己的房子，特征 A3 ，一共有两个类别，分别是：是、否。有自己的房子的数据，一共有6个，所以有工作为是的数据在训练数据集出现的概率是十五分之六。则没有自己的房子的数据在训练数据集出现的概率是十五分之九。有自己的房子的数据的最终得到贷款的概率为一，因为在六个数据中，全部拿到了最终的贷款，同理，没有自己的房子的数据最终得到贷款的概率为九分之三。所以计算有自己的房子的信息增益，过程如下：

g (D ， A 3) = H (D) - [6 15 H (D 1) + 9 15 H (D 2)] = 0.971 - [6 15 \times 0 + 9 15 (- 3 9 log 2 3 9 - 6 9 log 2 6 9)] = 0.971 - 0.551 = 0.420

4)信贷情况，特征 A4 ，一共有三个类别，分别是：一般、好、非常好。信贷情况一般的数据，一共有5个，所以信贷情况一般的数据在训练数据集出现的概率是十五分之五。则信贷情况好和信贷情况非常好的数据在训练数据集出现的概率分别是十五分之六和十五分之四。信贷情况一般的数据的最终得到贷款的概率为五分之一，同理，信贷情况好和信贷情况非常好的数据最终得到贷款的概率分别为六分之四和一。所以计算信贷情况的信息增益，过程如下：

g (D ， A 4) = H (D) - [5 15 H (D 1) + 6 15 H (D 2) + 4 15 H (D 3)] = 0.971 - [5 15 (- 1 5 log 2 1 5 - 4 5 log 2 4 5) + 6 15 (- 4 6 log 2 4 6 - 2 6 log 2 2 6) + 4 15 \times 0] = 0.971 - 0.608 = 0.363

最后，比较特征的信息增益，由于特征A3(有自己的房子)的信息增益值最大，所以选择 A3 作为最优特征。

3.1.5 代码实现：

在编写代码之前，我们先对数据集进行属性标注。

年龄：0代表青年，1代表中年，2代表老年；
有工作：0代表否，1代表是；
有自己的房子：0代表否，1代表是；
信贷情况：0代表一般，1代表好，2代表非常好；
类别(是否给贷款)：no代表否，yes代表是。

1）创建数据集，并计算经验熵了，代码编写如下:

# -*- coding: UTF-8 -*-
from math import log

"""
函数说明:创建测试数据集

Parameters:
    无
Returns:
    dataSet - 数据集
    labels - 分类属性
"""
def createDataSet():
    dataSet = [[0, 0, 0, 0, 'no'],         #数据集
            [0, 0, 0, 1, 'no'],
            [0, 1, 0, 1, 'yes'],
            [0, 1, 1, 0, 'yes'],
            [0, 0, 0, 0, 'no'],
            [1, 0, 0, 0, 'no'],
            [1, 0, 0, 1, 'no'],
            [1, 1, 1, 1, 'yes'],
            [1, 0, 1, 2, 'yes'],
            [1, 0, 1, 2, 'yes'],
            [2, 0, 1, 2, 'yes'],
            [2, 0, 1, 1, 'yes'],
            [2, 1, 0, 1, 'yes'],
            [2, 1, 0, 2, 'yes'],
            [2, 0, 0, 0, 'no']]
    labels = ['年龄', '有工作', '有自己的房子', '信贷情况']        #分类属性
    return dataSet, labels                #返回数据集和分类属性

"""
函数说明:计算给定数据集的经验熵(香农熵)

Parameters:
    dataSet - 数据集
Returns:
    shannonEnt - 经验熵(香农熵)
"""
def calcShannonEnt(dataSet):
    numEntires = len(dataSet)                        #返回数据集的行数
    labelCounts = {}                                #保存每个标签(Label)出现次数的字典
    for featVec in dataSet:                            #对每组特征向量进行统计
        currentLabel = featVec[-1]                    #提取标签(Label)信息
        if currentLabel not in labelCounts.keys():    #如果标签(Label)没有放入统计次数的字典,添加进去
            labelCounts[currentLabel] = 0
        labelCounts[currentLabel] += 1                #Label计数
    shannonEnt = 0.0                                #经验熵(香农熵)
    for key in labelCounts:                            #计算香农熵
        prob = float(labelCounts[key]) / numEntires    #选择该标签(Label)的概率
        shannonEnt -= prob * log(prob, 2)            #利用公式计算
    return shannonEnt                                #返回经验熵(香农熵)

if __name__ == '__main__':
    dataSet, features = createDataSet()
    print(dataSet)
    print(calcShannonEnt(dataSet))

代码运行结果如下图所示，代码是先打印训练数据集，然后打印计算的经验熵H(D)，程序计算的结果与我们统计计算的结果是一致的，如图3.2 所示：

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第3张图片

图3.1 输出结果

2）计算信息增益，选择最优特征，代码实现：

# -*- coding: UTF-8 -*-
from math import log

"""
函数说明:创建测试数据集

Parameters:
    无
Returns:
    dataSet - 数据集
    labels - 分类属性
"""
def createDataSet():
    dataSet = [[0, 0, 0, 0, 'no'],         #数据集
            [0, 0, 0, 1, 'no'],
            [0, 1, 0, 1, 'yes'],
            [0, 1, 1, 0, 'yes'],
            [0, 0, 0, 0, 'no'],
            [1, 0, 0, 0, 'no'],
            [1, 0, 0, 1, 'no'],
            [1, 1, 1, 1, 'yes'],
            [1, 0, 1, 2, 'yes'],
            [1, 0, 1, 2, 'yes'],
            [2, 0, 1, 2, 'yes'],
            [2, 0, 1, 1, 'yes'],
            [2, 1, 0, 1, 'yes'],
            [2, 1, 0, 2, 'yes'],
            [2, 0, 0, 0, 'no']]
    labels = ['年龄', '有工作', '有自己的房子', '信贷情况']        #分类属性
    return dataSet, labels                #返回数据集和分类属性

"""
函数说明:计算给定数据集的经验熵(香农熵)

Parameters:
    dataSet - 数据集
Returns:
    shannonEnt - 经验熵(香农熵)
"""
def calcShannonEnt(dataSet):
    numEntires = len(dataSet)                        #返回数据集的行数
    labelCounts = {}                                #保存每个标签(Label)出现次数的字典
    for featVec in dataSet:                            #对每组特征向量进行统计
        currentLabel = featVec[-1]                    #提取标签(Label)信息
        if currentLabel not in labelCounts.keys():    #如果标签(Label)没有放入统计次数的字典,添加进去
            labelCounts[currentLabel] = 0
        labelCounts[currentLabel] += 1                #Label计数
    shannonEnt = 0.0                                #经验熵(香农熵)
    for key in labelCounts:                            #计算香农熵
        prob = float(labelCounts[key]) / numEntires    #选择该标签(Label)的概率
        shannonEnt -= prob * log(prob, 2)            #利用公式计算
    return shannonEnt                                #返回经验熵(香农熵)

"""
函数说明:按照给定特征划分数据集

Parameters:
    dataSet - 待划分的数据集
    axis - 划分数据集的特征
    value - 需要返回的特征的值
Returns:
    无
"""
def splitDataSet(dataSet, axis, value):       
    retDataSet = []                                        #创建返回的数据集列表
    for featVec in dataSet:                             #遍历数据集
        if featVec[axis] == value:
            reducedFeatVec = featVec[:axis]                #去掉axis特征
            reducedFeatVec.extend(featVec[axis+1:])     #将符合条件的添加到返回的数据集
            retDataSet.append(reducedFeatVec)
    return retDataSet                                      #返回划分后的数据集

"""
函数说明:选择最优特征

Parameters:
    dataSet - 数据集
Returns:
    bestFeature - 信息增益最大的(最优)特征的索引值
"""
def chooseBestFeatureToSplit(dataSet):
    numFeatures = len(dataSet[0]) - 1                    #特征数量
    baseEntropy = calcShannonEnt(dataSet)                 #计算数据集的香农熵
    bestInfoGain = 0.0                                  #信息增益
    bestFeature = -1                                    #最优特征的索引值
    for i in range(numFeatures):                         #遍历所有特征
        #获取dataSet的第i个所有特征
        featList = [example[i] for example in dataSet]
        uniqueVals = set(featList)                         #创建set集合{},元素不可重复
        newEntropy = 0.0                                  #经验条件熵
        for value in uniqueVals:                         #计算信息增益
            subDataSet = splitDataSet(dataSet, i, value)         #subDataSet划分后的子集
            prob = len(subDataSet) / float(len(dataSet))           #计算子集的概率
            newEntropy += prob * calcShannonEnt(subDataSet)     #根据公式计算经验条件熵
        infoGain = baseEntropy - newEntropy                     #信息增益
        print("第%d个特征的增益为%.3f" % (i, infoGain))            #打印每个特征的信息增益
        if (infoGain > bestInfoGain):                             #计算信息增益
            bestInfoGain = infoGain                             #更新信息增益，找到最大的信息增益
            bestFeature = i                                     #记录信息增益最大的特征的索引值
    return bestFeature                                             #返回信息增益最大的特征的索引值

if __name__ == '__main__':
    dataSet, features = createDataSet()
    #print(dataSet)
    #print(calcShannonEnt(dataSet))
    print("最优特征索引值:" + str(chooseBestFeatureToSplit(dataSet)))

代码运行结果如下图所示，代码是先打印训练数据集，然后打印计算的经验熵H(D)，程序计算的结果与我们统计计算的结果是一致的，如图3.3 所示：

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第4张图片

图3.2 输出结果

最优特征的索引值为2，也就是特征

A3 (有自己的房子)。

3.2 决策树的生成

已经知道了从数据集构造决策树算法所需的子功能模块，其工作原理如下：
得到原始数据集，然后基于最好的属性值划分数据集，由于特征值可能多于两个，因此可能存在大于两个分支的数据集划分。第一次划分之后，数据将被向下传递到树分支的下一个结点，在这个结点上，我们可以再次化数据，因此可以采用递归的原则处理数据集。
递归结束的条件是：程序遍历完所有划分数据集的属性，或者每个分支下的所有实例都具有相同的分类。如果所有实例都具有相同的分类，则得到一个叶子结点或者终止块。任何到达叶子结点的数据必然属于叶子结点的分类。

3.2.1 ID3算法

ID3算法的核心是在决策树各个结点上对应信息增益准则选择特征，递归地构建决策树。具体方法是：从根结点(root node)开始，对结点计算所有可能的特征的信息增益，选择信息增益最大的特征作为结点的特征，由该特征的不同取值建立子结点；再对子结点递归地调用以上方法，构建决策树；直到所有特征的信息增益均很小或没有特征可以选择为止，最后得到一个决策树。ID3相当于用极大似然法进行概率模型的选择。
输入：训练数据集D，特征集A，阈值 ϵ
输出：决策树T

若D中所有实例属于同一类 Ck ，则T树为单结点树，并将类 Ck 作为该结点的类标记，返回T；
若A= ∅ ，则T为单结点树，并将D中实例数最大的类 Ck 作为该结点的类标记，返回T;
否则，按算法计算A中各特征对D的信息增益，选择信息增益最大的特征 Ag ；
如果 Ag 的信息增益小于阈值 ϵ ，则置T为单结点树，并将D中实例数最大的类 Ck 作为该结点的类标记，返回T;
否则，对 Ag 的每一可能值 ai ，依 Ag=ai 将D分割为若干个非空子集 Di ，将 Di 中的实例数最大的类作为标记，构建子结点，由结点及其子结点构成树T，返回T；
对第i个子结点，以 Di 为训练集，以A- Ag 为特征集，递归调用步(1)~步(5)，得到子树 Ti ，返回 Ti

对表3.1的训练数据集，利用ID3算法建立决策树：
利用上面的结果，由于特征 A3 (有自己的房子)的信息增益值最大，所以选择特征 A3 作为根结点的特征。它将训练集D划分为两个子集 D1 ( A3 取值为”是”)和 D2 ( A3 取值为”否”)。由于 D1 只有同一类的样本点，所以它成为一个叶结点，结点的类标记为“是”。
对 D2 则需要从特征 A1 (年龄)， A2 (有工作)和 A4 (信贷情况)中选择新的特征，计算各个特征的信息增益：

g(D2,A1)=H(D2)−H(D2|A1)=0.918−0.667=0.251
g(D2,A2)=H(D2)−H(D2|A2)=0.918
g(D2,A4)=H(D2)−H(D2|A4)=0.474

根据计算，选择信息增益最大的特征 A2 (有工作)作为结点的特征。由于 A2 有两个可能取值，从这一结点引出两个子结点：一个对应”是”(有工作)的子结点，包含3个样本，它们属于同一类，所以这是一个叶结点，类标记为”是”；另一个是对应”否”(无工作)的子结点，包含6个样本，它们也属于同一类，所以这也是一个叶结点，类标记为”否”。
这样就生成了一个决策树，该决策树只用了两个特征(有两个内部结点)，生成的决策树如下图所示。

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第5张图片

图3.3 决策树的生成

ID3算法只要树的生成，所以该算法生成的树容易产生过拟合。

3.2.2 C4.5算法

C4.5算法与ID3算法相似，C4.5算法对ID3算法，进行了改进，C4.5在生成的过程中，使用信息增益比来选择特征。
输入：训练数据集D，特征集A，阈值 ϵ
输出：决策树T

若D中所有实例属于同一类 Ck ，则T树为单结点树，并将类 Ck 作为该结点的类标记，返回T；
若A= ∅ ，则T为单结点树，并将D中实例数最大的类 Ck 作为该结点的类标记，返回T;
否则，按算法计算A中各特征对D的信息增益比，选择信息增益比最大的特征 Ag ；
如果 Ag 的信息增益比小于阈值 ϵ ，则置T为单结点点树，并将D中实例数最大的类 Ck 作为该结点的类标记，返回T;
否则，对 Ag 的每一可能值 ai ，依 Ag=ai 将D分割为若干个非空子集 Di ，将 Di 中的实例数最大的类作为标记，构建子结点，由结点及其子结点构成树T，返回T；
对第i个子结点，以 Di 为训练集，以A- Ag 为特征集，递归调用步(1)~步(5)，得到子树 Ti ，返回 Ti

3.2.3 编写代码构建决策树

添加函数majorityCnt()，该函数使用分类名称的列表，然后创建键值为classList中唯一值得数据字典，字典对象中存储了classList中每个类标签出现的频率，最后利用operator操作键值排序字典，并返回出现次数最多的分类名称。

"""
函数说明:统计classList中出现此处最多的元素(类标签)

Parameters:
    classList - 类标签列表
Returns:
    sortedClassCount[0][0] - 出现此处最多的元素(类标签)
"""
def majorityCnt(classList):
    classCount = {}
    for vote in classList:    #统计classList中每个元素出现的次数
        if vote not in classCount.keys():classCount[vote] = 0   
        classCount[vote] += 1
    sortedClassCount = sorted(classCount.items(), key = operator.itemgetter(1), reverse = True)        #根据字典的值降序排序
    return sortedClassCount[0][0]    #返回classList中出现次数最多的元素

添加函数createTree()，创建决策树，传入两个参数：数据集和标签列表，标签列表中包含了数据集中所有特征的标签，递归有两个终止条件：第一个停止条件是所有的类标签完全相同，则直接返回该类标签；第二个停止条件是使用完了所有特征，仍然不能将数据划分仅包含唯一类别的分组，即决策树构建失败，特征不够用。此时说明数据纬度不够，由于第二个停止条件无法简单地返回唯一的类标签，这里使用majorityCnt函数挑选出现数量最多的类别作为返回值。
我们使用字典存储决策树的结构，比如上小节我们分析出来的决策树，用字典可以表示为：

{'有自己的房子': {0: {'有工作': {0: 'no', 1: 'yes'}}, 1: 'yes'}}

字典变量myTree存储了树的所有信息，当前数据集选取的最好特征存储在变量bestFeat中，得到的列表包含所有属性值。
最后，代码遍历当前选择特征包含的所有属性值，在每个数据集划分上递归调用函数createTree()，得到的返回值将插入到字典变量myTree中，因此函数终止执行时，字典中将会嵌套很多代表叶子节点信息的字典数据

"""
函数说明:创建决策树

Parameters:
    dataSet - 训练数据集
    labels - 分类属性标签
    featLabels - 存储选择的最优特征标签
Returns:
    myTree - 决策树
"""
def createTree(dataSet, labels, featLabels):
    classList = [example[-1] for example in dataSet]            #取分类标签(是否放贷:yes or no)
    if classList.count(classList[0]) == len(classList):            #如果类别完全相同则停止继续划分
        return classList[0]
    if len(dataSet[0]) == 1:                                    #遍历完所有特征时返回出现次数最多的类标签
        return majorityCnt(classList)
    bestFeat = chooseBestFeatureToSplit(dataSet)                #选择最优特征
    bestFeatLabel = labels[bestFeat]                            #最优特征的标签
    featLabels.append(bestFeatLabel)
    myTree = {bestFeatLabel:{}}                                    #根据最优特征的标签生成树
    del(labels[bestFeat])                                        #删除已经使用特征标签
    featValues = [example[bestFeat] for example in dataSet]        #得到训练集中所有最优特征的属性值
    uniqueVals = set(featValues)                                #去掉重复的属性值
    for value in uniqueVals:                                    #遍历特征，创建决策树。
        subLabels=labels[:]
        myTree[bestFeatLabel][value] = createTree(splitDataSet(dataSet, bestFeat, value), subLabels, featLabels)
    return myTree

if __name__ == '__main__':
    dataSet, labels = createDataSet()
    #print(dataSet)
    #print(calcShannonEnt(dataSet))
    #print("最优特征索引值:" + str(chooseBestFeatureToSplit(dataSet)))
    featLabels = []
    myTree = createTree(dataSet, labels, featLabels)
    print(myTree)

运行结果如图3.4 所示：

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第6张图片

图3.4 构建决策树运行结果

3.3 决策树的修剪

决策树生成算法递归地产生决策树，知道不能继续下去为止，这样产生的树往往对训练数据的分类很准确，但是对未知的测试数据的分类却没有那么准确，即出现过拟合现象，过拟合的原因在于学习时过多的考虑如何提高对训练数据的正确分类，从而构建出过于复杂的的决策树，解决这个问题的办法是，考虑决策树的复杂度，对已生成的决策树进行简化。

在决策树学习中将已生成的树进行简化的过程称为剪枝（pruning）,具体地，剪枝从已生成的树上裁掉一些树或叶子结点，将其根结点或父结点作为新的叶子结点，从而简化分类树模型。

决策树的剪枝往往通过极小化决策树整体的损失函数（loss function）或代价函数（cost function）来实现。设T树的叶子结点个数为|T|，t是树T的叶子结点，该叶子结点有 Nt 个样本点，其中k类的样本点有 Ntk 个，k=1，2，……，K, Ht(T) 为叶子结点t上的经验熵， α≥ 0为参数，则决策树学习的损失函数可以定义为：

C α (T ） = \sum t = 1 | T | N t H t (T) + α | T |

其中经验熵为：

H t (T) = - \sum k N t k N t log N t k N t

在损失函数中，右端的第一项记作：

C (T) = \sum t = 1 | T | N t H t (T) = - \sum t = 1 | T | N t \sum k = 1 K N t k log N t k N t

这时有

Cα(T)=C(T)+α|T|
C(T)表示模型对训练数据的预测误差，即模型与训练数据的拟合程度，|T|表示模型复杂度，参数

α≥0 控制两者之间的影响，较大的

α 促使选择较简单的模型（树），较小的

α 促使选择较复杂的模型（树），

α=0 意味着只考虑模型与训练数据的拟合程度，不考虑模型的复杂度。

剪枝，就是当 α 确定时，选择损失函数最小的模型，即损失函数最小的子树，当 α 确定时，子树越大，往往与训练数据的拟合越好，但是模型的复杂度越高，相反，子树越小，模型的复杂度越低，但是往往与训练数据的拟合不好，损失函数正好表示了两者的平衡。

可以看出决策树生成只考虑了通过提高信息增益（或信息增益比）对训练数据更好的拟合，而决策树剪枝通过优化损失函数还考虑了较小模型复杂度。决策树生成学习的局部模型，而决策树剪枝学习整体的模型。利用损失函数最小原则进行剪枝就是用政策化的极大似然估计进行模型选择。

树的剪枝算法：
输入：生成算法产生的整个树T，参数 α
输出：修剪后的子树 Tα

计算每个结点的经验熵
递归地从树的叶子结点向上回缩
设一组叶子结点回缩到其父结点之前与之后的整体树分别为 TB 与 TA ，其对应的损失函数值分别是 Cα(TB) 与 Cα(TA) ，如果
$C α (T A) \leq C α (T B)$
则进行剪枝，将其父结点变为新的叶子结点。
返回（2）直至不能继续为止，得到损失函数最小的子树 Tα

如图3.5 决策树的剪枝所示：

《机器学习实战》学习笔记（二）之决策树（上）决策树的生成及修剪，ID3,C4.5CART算法_第7张图片

图3.5 决策树的剪枝

注意，

Cα(TA)≤Cα(TB) 只考虑两个树的损失函数的差，其计算可以在局部进行，所以决策树的剪枝算法可以由一种动态规划的算法实现。

3.4 CART算法

分类与回归树（classification and regression tree，CART）模型有Breiman等人在1984年提出，是应用广泛的决策树学习方法，CART同样由特征选择，树的生成以及剪枝组成，既可以用于分类也可以用于回归。

CART是在给定输入随机变量X的条件下输出随机变量Y的条件概率分布的学习方法。CART假设决策树是二叉树，内部结点特征的取值为“是”和“否”，左分支是取值为“是”的分支，右分支是取值为“否”的分支，这样的决策树等价于递归地二分每个特征，将输入空间即特征空间划分为有限个单元，并在这些单元上确定预测的概率分布，也就是在输入给定的条件下输出的条件概率分布。

CART算法有一下两步组成：

决策树生成：基于训练数据集生成决策树，生成的决策树要尽量大；
决策树剪枝：用验证数据集对已生成的树进行剪枝并最优子树，这时用损失函数最小作为剪枝的标准。

3.4.1 CART生成

决策树的生成就是递归地构建二叉决策树的过程，对回归树用平方误差最小化准则，对分类树用基尼指数（Gini index）最小化准则，进行特征选择，生成二叉树。

3.4.1.1 回归树的生成

假设X与Y分别为输入输出变量，并且Y是连续变量，给定训练数据集： D={(x1,y1),(x2,y2),...,(xN,yN)} ，考虑如何生成回归树。

一个回归树对应着输入空间（即特征空间），的一个划分以及在划分单元上的输出值，假设已将输入空间划分为M各单元 R,R2..RM ,并且在每个单元 Rm 上有一个固定的输出值 Cm ，回归树模型可以表示为：

f (x) = \sum m = 1 M c m I (x \in R m)

当输入空间的划分确定时，可以用平法误差

∑xi∈Rm(yi−f(xi))2 来表示回归树对于训练数据的预测误差，用平方误差最小准则，求解每个单元上的最优输出值。易知，单元

Rm 上的

cm 的最优值

c^m 是

Rm 上的所有输入实例

xi 对应的输出

yi 的均值，即：

c^m = a v e (y i | x i \in R m)

问题是如何对输入空间进行划分？这里采用的是启发式的方法：选择第j个变量

x(j) 和它取的值s，作为切分变量(splitting variable)和切分点（splitting point），并定义两个区域：

R 1 (j, s) = {x | x j \leq s} 和 R 2 (j, s) = {x | x j > s}

然后寻找最优切分变量j和切分点s，具体的求解:

min j, s ⎡ ⎣ min c 1 \sum x i \in R 1 (j, s) (y i - c 1) 2 + min c 2 \sum x i \in R 2 (j, s) (y i - c 2) 2 ⎤ ⎦

对固定输入变量j可以找到最优切分点s.

c^1 = a v e (y i | x i \in R 1 (j, s)) 和 c^2 = a v e (y i | x i \in R 2 (j, s))

遍历所有输入变量，找到最优的切分变量j，构成一对（j,s），依次将输入空间划分为两个区域，接着对每个区域重复上述划分过程，知道满足停止条件为止，这样就生成一棵回归树。这样的回归树通常称为 最小二乘回归树（least squares regression tree）。

最小二乘回归树生成算法：
输入：训练数据集D
输出：回归树f(x)
在训练数据集所在的输入空间中，递归地将每个区域划分为两个子区域并决定每个子区域上的输出值，构建二叉树：

选择最优切分变量j与切分点s，求解
$min j, s ⎡ ⎣ min c 1 \sum x i \in R 1 (j, s) (y i - c 1) 2 + min c 2 \sum x i \in R 2 (j, s) (y i - c 2) 2 ⎤ ⎦$

遍历变量j，对固定的切分变量j扫描切分点s，选择达到最小值的(j,s)。
用选定的对(j,s)划分区域，并决定相应的输出值：

$R 1 (j, s) = {x | x j \leq s} 和 R 2 (j, s) = {x | x j > s}$
$c^m = 1 N m \sum x i \in R m (j, s) y i ， (x \in R m ， m = 1 ， 2)$
继续对两个子区域调用步骤1,2，直至满足停止条件。
将输入空间划分为M个区域 R1,R2,...,RM ，生成决策树：
$f (x) = \sum m = 1 M c^m I (x \in R m)$

3.4.1.2 分类树的生成

3.4.2 CART剪枝

你可能感兴趣的:(机器学习实战,机器学习,决策树,熵,信息增益,id3算法)

3.22 codeforces小结 Brokenrivers 总结随记 Codeforces 算法竞赛编译错误签到题实战经验
说来好笑，也算接触小半年算法了，这次算是第一次"正式"的打cf。之前因为一些原因比较倾向于找个空闲时间上oj上刷题，虽然知道cf对一个搞算法竞赛的人的重要性，但是一直没去蹲点打比赛（我觉得就是我们宿舍这破网上个cf要转两分钟圈圈还经常崩的原因），最多会在比赛结束找比赛题目的文档练习。这次因为组队了，希望能和队友实时交流，手机开了梯子热点打完了这次的cf。感觉就是，自己像个傻子一样，提交代码的语言选
从零开始学AI——1 人工智能
前言最近总算有想法回到学习上来，这次就拿AI开刀吧。本系列叫从零开始学AI不是骗人的，我对AI的了解几乎就是道听途说，所以起了这么一个标题，希望学完从0变1（？此外，我应该不会特别关注代码实现上的内容，因为我对python也是一窍不通。本笔记为学习周志华老师《机器学习》（西瓜书）的个人学习记录，内容基于个人理解进行整理和再阐述。由于理解可能存在偏差，欢迎指正。引用模块说明：在笔记中，我会使用引用模
蓝桥杯算法实战：技巧、策略与进阶之路竣雄蓝桥杯算法职场和发展
摘要蓝桥杯作为国内颇具影响力的程序设计竞赛，对提升大学生算法思维与编程能力意义重大。本文深入剖析蓝桥杯算法竞赛，结合历年真题总结核心考点与典型题型，分享实用解题技巧与备考策略，并探讨算法优化与进阶方向。通过系统学习与实践，助力参赛者提升算法水平，在竞赛中取得优异成绩。关键词蓝桥杯；算法竞赛；解题技巧；备考策略；算法优化一、引言蓝桥杯全国软件和信息技术专业人才大赛旨在选拔优秀的软件和信息技术人才，推
算法小分队-刷题2 「已注销」 c++
注：代码周日刷完一块交3.20小鱼的游泳时间(1425)模拟竖式运算，注意借位问题3.21小鱼比可爱(1428)简单的循环比较大小3.22小玉在游泳(1420)注意数据的处理，浮点还是整数3.23手机(1765)只会简单的条件循环判断然后累加3.24轰炸III(1830)调错：轰炸的次序处理
Java实现生日悖论的算法，计算至少有两个人生日相同的概率 YiWait java 算法
importjava.util.Random;publicclassBirthdayParadox{publicstaticvoidmain(String[]args){intn=23;//邀请的人数inttrials=1000000;//实验次数intcount=0;//至少有两个人生日相同的实验次数Randomrand=newRandom();for(inti=0;i
算法竞赛备赛——【数论】高精度 Aurora_wmroy 算法竞赛备赛算法 c++数据结构蓝桥杯
高精度高精度计算，也被称作大整数计算，运用了一些算法结构来支持更大整数间的运算（数字大小超过语言内建整型）。加法P1601A+BProblem（高精）-洛谷#includeusingnamespacestd;constintN=10100;inta[N],b[N],c[N];intinit(intx[]){//读入数返回位数strings;cin>>s;intl=s.size();for(inti
算法竞赛备赛——【数据结构】链表 Aurora_wmroy 算法竞赛备赛数据结构算法链表 c++蓝桥杯
链表原地逆置206.反转链表-力扣（LeetCode）classSolution{public:ListNode*reverseList(ListNode*head){//链表无头节点原地逆置ListNode*pre=head;ListNode*cur=NULL;ListNode*t=NULL;//t=head->next若head指向空链表会报错非法访问其他空间while(pre!=NULL){
啸叫抑制（AFS）从算法仿真到工程源码实现-第一节-效果演示 aflyingwolf_pomelo 语音信号处理算法人工智能
一、概述啸叫抑制算法也叫声反馈抑制，本专题我们讨论啸叫抑制算法的平台搭建，算法仿真和设备端的工程落地实现。完整记录一个扩声系统的搭建。更多资料和代码可以进入https://t.zsxq.com/qgmoN，同时欢迎大家提出宝贵的建议，以共同探讨学习。二、啸叫抑制算法视频演示啸叫抑制算法演示视频三、语谱图3.1产生啸叫效果3.2去啸叫后的效果四、总结这一节我们主要记录了啸叫抑制（去啸叫）算法的效果演
Python 学习第五册深度学习第1章什么是深度学习 weixin_38135241 python 学习深度学习人工智能
----用教授的方式学习。目录1.1人工智能、机器学习与深度学习1.1.1人工智能1.1.2机器学习1.1.3从数据中学习表示1.1.4深度学习之“深度”1.1.5用三张图理解深度学习的工作原理1.2深度学习之前：机器学习简史1.2.1概率建模1.2.2核方法1.2.3决策树、随机森林与梯度提升机1.2.4深度学习有何不同什么是深度学习？1.1人工智能、机器学习与深度学习三者关系：1.1.1人工智
群体智能优化算法-模拟退火优化算法（Simulated Annealing, SA，含Matlab源代码） HR Zhou 算法模拟退火算法机器学习 matlab 群体智能优化优化人工智能
摘要模拟退火（SA）算法是一种基于物理退火过程的全局优化算法，其核心思想来源于热力学中的退火过程：将材料加热到高温后再缓慢冷却，使其分子结构趋于最低能量状态，从而获得稳定结构。SA算法利用Metropolis准则来决定接受新的解，以一定概率接受劣解，从而避免陷入局部最优。SA具有收敛速度快、计算复杂度低、适用于连续优化问题等特点，被广泛应用于组合优化、函数优化、神经网络训练等领域。算法介绍1.主要
珍藏！Java SpringBoot 精品源码合集约惠来袭，获取路径大公开秋野酱 java spring boot 开发语言
技术范围：SpringBoot、Vue、SSM、HLMT、Jsp、PHP、Nodejs、Python、爬虫、数据可视化、小程序、安卓app、大数据、物联网、机器学习等设计与开发。主要内容：免费功能设计、开题报告、任务书、中期检查PPT、系统功能实现、代码编写、论文编写和辅导、论文降重、长期答辩答疑辅导、腾讯会议一对一专业讲解辅导答辩、模拟答辩演练、和理解代码逻辑思路。文末获取源码联系文末获取源码联
相同的问题看看Grok3怎么回答-详细讲讲PPO & GRPO原理释迦呼呼 AI一千问人工智能深度学习机器学习语言模型算法神经网络计算机视觉
关键要点研究表明，PPO（近端策略优化）是一种稳定高效的强化学习算法，适用于单代理或多代理场景，重点是最大化绝对奖励。GRPO（基于梯度的相对策略优化）似乎是专为多代理系统设计的，优化代理之间的相对表现，目前信息有限，可能较少为人所知。这两个算法在目标和应用领域上有显著差异，PPO更通用，GRPO更适合竞争性多代理环境。关于PPO的解释什么是PPO？PPO，全称近端策略优化，是一种强化学习算法，帮
第三十九个问题-详细讲讲PPO & GRPO原理释迦呼呼 AI一千问人工智能深度学习机器学习语言模型自然语言处理算法
PPO（ProximalPolicyOptimization）原理详解PPO（近端策略优化）是OpenAI于2017年提出的强化学习算法，旨在解决传统策略梯度方法中训练不稳定和样本效率低的问题。其核心思想是通过限制策略更新的幅度，确保新策略不会偏离旧策略太远，从而稳定训练过程。1.策略梯度（PolicyGradient）基础策略梯度方法通过直接优化策略参数θθ来最大化期望回报。目标函数为：J(θ)
代码随想录算法训练营第四十一天 | hot65/100| 33.搜索旋转排序数组、153.寻找旋转排序数组中的最小值、155.最小栈、394.字符串解码 boguboji 刷题算法 leetcode 数据结构
33.搜索旋转排序数组思路是：数组可能有两种情况2345671和6712345将数组一分为二，其中一定有一个是有序的，每次判断前半部分是有序的还是后半部分是有序的，每次只在有序的那部分里找。无序那部分不管（没找到会重新一分为二，继续在有序的一半里找，迟早会找到）注意点：这道题重点是记住边界条件（哪些是小于等于小于大于等于大于）有小于等于/大于等于的情况是因为，如果出现[2,1]中找1的情况，需要有
代码随想录算法训练营第三十八天 | hot57/100| 114.二叉树展开为链表、437.路径总和III、124.二叉树中的最大路径和、22.括号生成 boguboji 刷题算法链表数据结构
114.二叉树展开为链表思路是：（1）定义方法，先序遍历保证顺序，把节点按顺序保存（2）再for循环转成链表，一列都是往右排列完整代码：classSolution{ publicvoidflatten(TreeNoderoot){ Listlist=newArrayList(); preorderTraversal(root,list); intsize=list.size()
代码随想录算法训练营第十天 | 栈与队列part01| 232.用栈实现队列、225. 用队列实现栈、 20. 有效的括号、1047. 删除字符串中的所有相邻重复项 boguboji 刷题算法 java 开发语言
232.用栈实现队列栈与队列的基本知识：Stackstack=newStackq=newLinkedListstack=newStack显然是存储整数类型，如果要存储字符，应该用Dequedeque=newLinkedListstack=newStack<>();还有我写for(inti=0;i
代码随想录算法训练营第二十三天 | 回溯算法part02| 39. 组合总和、40.组合总和II、131.分割回文串 boguboji 刷题算法数据结构
39.组合总和这道题和前面组合问题的区别是，取的元素可以重复，也就是遍历的时候，同一个元素可以一直取。所以for循环里，逐个添加元素，判断和大于目标时break（否则会一直加）还是新建二维数组放结果，一维数组放path。输入参数为放结果数组、path、提供的数组、目标值、目前总和sum、startIndex提前把提供的数组排序，用Arrays.sort()这样sum超过target就break递归
java架构设计-COLA 芸尚非 java 开发语言
参考：https://github.com/alibaba/COLA架构要素：组成架构的重要元素结构：要素直接的关系意义：定义良好的结构，治理应用复杂度，降低系统熵值，改善混乱状态创建COLA应用：mvnarchetype:generate\-DgroupId=com.alibaba.cola.demo.web\-DartifactId=demo-web\-Dversion=1.0.0-SNAPS
机器学习驱动的智能化电池管理技术与应用满木悦电池化学机器人化学电池机器学习人工智能硕博研究生
在人工智能与电池管理技术融合的背景下，电池科技的研究和应用正迅速发展，创新解决方案层出不穷。从电池性能的精确评估到复杂电池系统的智能监控，从数据驱动的故障诊断到电池寿命的预测优化，人工智能技术正以其强大的数据处理能力和模式识别优势，推动电池管理领域的技术进步。据最新研究动态，目前在电池管理领域的人工智能应用主要集中在以下几个方面：1.状态估计：包括电池的荷电状态（SOC）和健康状态（SOH）的实时
目标检测YOLO实战应用案例100讲-基于深度学习的无人机目标检测算法轻量化研究（中）林聪木目标检测 YOLO 深度学习
目录基于改进YOLOv5的无人机图像实时目标检测4.1引言4.2基于改进YOLOv5的目标检测模型结构4.3消融实验及结果分析4.4算法迁移验证实验基于Jetson-Xavier的模型优化部署5.1引言5.2基于人在回路的目标检测模型裁剪5.3嵌入式实时目标检测交互软件基于深度学习的无人机目标检测算法轻量化研究知识拓展基于YOLOv8/YOLOv7/YOLOv6/YOLOv5的无人机目标检测1.数
云智慧：拥抱AI算法驱动的智能运维服务创新引擎
随着信息化、数字化、智能化的加码，企业对人工智能、大数据等技术应用呈现出明显兴趣，海笔研究对国内中型规模企业调研表明，在2020年，54.1%的企业选择购买人工智能类应用，41.9%的企业选择购买大数据及BI类应用，各类产品软件的应用大幅提升了企业信息系统复杂度，以及运维管理难度。业务发展催生服务需求从系统管理者角度出发，信息系统从“单机Excel表格”到“集中式单系统”再到“微服务、云架构”等，
双指针与二分算法打不了嗝蓝桥杯 c++算法
一.双指针1.基本介绍双指针算法是一种暴力枚举的优化算法，他也被叫做尺取法或者滑动窗口。当我们发现算法需要两次for循环时并且两个指针可以不回退，我们可以利用双指针来优化算法复杂度。2.例题详解题目描述企业家Emily有一个很酷的主意：把雪花包起来卖。她发明了一台机器，这台机器可以捕捉飘落的雪花，并把它们一片一片打包进一个包裹里。一旦这个包裹满了，它就会被封上送去发售。Emily的公司的口号是“把
算法刷题区域部分反转无敌的牛算法算法
不断创建数组，相加，利用cpp内字符串相加的性质即可。具体代码如下：classSolution{public:stringreverseStr(strings,intk){intsize=s.size();intcount=size/(2*k);stringa;inti=0;for(i=0;ik){reverse(a2.begin(),a2.begin()+k);}else{reverse(a2.
优选算法训练篇07--力扣LCR179.查找总价格为目标值的两个商品大胆飞猪算法训练篇算法 leetcode
目录1.题目链接：LCR179.查找总价格为目标值的两个商品2.题目描述：3.解法一(暴力解法，会超时)：4.解法二(双指针-对撞指针):1.题目链接：LCR179.查找总价格为目标值的两个商品2.题目描述：购物车内的商品价格按照升序记录于数组price。请在购物车中找到两个商品的价格总和刚好是target。若存在多种情况，返回任一结果即可。示例1：输入：price=[3,9,12,15],tar
LeetCode215. 数组中的第K个最大元素 techpupil 算法快速选择 leetcode
给定整数数组nums和整数k，请返回数组中第k个最大的元素。请注意，你需要找的是数组排序后的第k个最大的元素，而不是第k个不同的元素。你必须设计并实现时间复杂度为O(n)的算法解决此问题。示例1:输入:[3,2,1,5,6,4],k=2输出:5示例2:输入:[3,2,3,1,2,4,5,5,6],k=4输出:4分析：本题我们能想到最简单的方法就是直接给数组排序，然后取第第N-k个元素，但题目要求是
SM国密算法深度解析与技术实践安全
SM国密算法深度解析与技术实践一、算法体系概述SM系列密码算法是由中国国家密码管理局发布的商用密码标准体系，涵盖非对称加密、对称加密、杂凑算法、标识密码等多个领域。其核心组件包括：SM2：基于椭圆曲线的非对称加密算法（GB/T32918）SM3：密码杂凑算法（GB/T32905）SM4：分组对称加密算法（GB/T32907）与国际算法对比类型国密算法国际标准密钥长度安全强度非对称加密SM2RSA-
梯度下降法理论理解伶星37 机器学习人工智能
梯度下降法：看似原始却透露着机器学习的本质前提：在研究梯度下降方法之前，你要理解矩阵运算（解析解）的方法矩阵运算目前的缺点只能进行对线性函数经行分析，无法对复杂的函数经行分析什么是梯度，以及梯度向量梯度下降的形象例子以及基本思想有三个兄弟被困在山上，得要死，他们目标是看谁尽快找到山谷中的水源老大比较后选择最陡的方向随便探索一下，就朝较低处走去探测几下就走陡峭的方向梯度下降算法的核心思想就是沿着负梯
2.服务器负载均衡我是一条胖咸鱼华为安全HCIP 网络服务器安全负载均衡华为
1.服务器负载均衡概述负载均衡基本概念实服务器：处理业务流量的实体服务器，客户端发送的服务请求最终是由实服务器处理的。实服务器组：由多个实服务器组成的集群，对外提供特定的一种服务。虚拟服务器：实服务器组对外呈现的逻辑形态，客户端实际访问的是虚拟服务器。负载均衡算法：FW分配业务流量给实服务器时依据的算法，不同的算法可能得到不同的分配结果。服务健康检查：FW检查服务器状态是否正常的过程，可以增强为用
AI大模型产品经理学习路线，2025最新，从AI产品经理零基础入门到精通，非常详细收藏我这一篇够了！ AGI-杠哥人工智能产品经理学习语言模型 agi 自然语言处理
随着人工智能技术的发展，尤其是大模型（LargeModel）的兴起，越来越多的企业开始重视这一领域的投入。作为大模型产品经理，你需要具备一系列跨学科的知识和技能，以便有效地推动产品的开发、优化和市场化。以下是一份详细的大模型产品经理学习路线，旨在帮助你构建所需的知识体系，从零基础到精通。一、基础知识阶段1.计算机科学基础数据结构与算法：理解基本的数据结构（如数组、链表、树、图等）和常用算法（如排序
使用 Spring Security的一些常用功能代码代码快快显灵 springsecurity spring java 前端 SpringSecurity
在实际开发中，SpringSecurity常常涉及一些常用的功能。以下是一些在开发中经常使用的SpringSecurity功能：1.PasswordEncoderBean（密码加密）这段配置使用BCryptPasswordEncoder作为密码加密算法。它是SpringSecurity中常用的密码加密方式，通常用于存储和验证用户的密码。@BeanpublicPasswordEncoderpassw
HttpClient 4.3与4.3版本以下版本比较 spjich java httpclient
网上利用java发送http请求的代码很多，一搜一大把，有的利用的是java.net.*下的HttpURLConnection，有的用httpclient，而且发送的代码也分门别类。今天我们主要来说的是利用httpclient发送请求。 httpclient又可分为 httpclient3.x httpclient4.x到httpclient4.3以下 httpclient4.3
Essential Studio Enterprise Edition 2015 v1新功能体验 Axiba .net
概述：Essential Studio已全线升级至2015 v1版本了！新版本为JavaScript和ASP.NET MVC添加了新的文件资源管理器控件，还有其他一些控件功能升级，精彩不容错过，让我们一起来看看吧！ syncfusion公司是世界领先的Windows开发组件提供商，该公司正式对外发布Essential Studio Enterprise Edition 2015 v1版本。新版本
[宇宙与天文]微波背景辐射值与地球温度 comsci 背景
宇宙这个庞大,无边无际的空间是否存在某种确定的,变化的温度呢? 如果宇宙微波背景辐射值是表示宇宙空间温度的参数之一,那么测量这些数值,并观测周围的恒星能量输出值,我们是否获得地球的长期气候变化的情况呢? &nbs
lvs-server 男人50 server
#!/bin/bash # # LVS script for VS/DR # #./etc/rc.d/init.d/functions # VIP=10.10.6.252 RIP1=10.10.6.101 RIP2=10.10.6.13 PORT=80 case $1 in start) /sbin/ifconfig eth2:0 $VIP broadca
java的WebCollector爬虫框架 oloz 爬虫
WebCollector主页： https://github.com/CrawlScript/WebCollector 下载：webcollector-版本号-bin.zip将解压后文件夹中的所有jar包添加到工程既可。接下来看demo package org.spider.myspider; import cn.edu.hfut.dmic.webcollector.cra
jQuery append 与 after 的区别小猪猪08
1、after函数定义和用法： after() 方法在被选元素后插入指定的内容。语法： $(selector).after(content) 实例： <html> <head> <script type="text/javascript" src="/jquery/jquery.js"></scr
mysql知识充电香水浓 mysql
索引索引是在存储引擎中实现的，因此每种存储引擎的索引都不一定完全相同，并且每种存储引擎也不一定支持所有索引类型。根据存储引擎定义每个表的最大索引数和最大索引长度。所有存储引擎支持每个表至少16个索引，总索引长度至少为256字节。大多数存储引擎有更高的限制。MYSQL中索引的存储类型有两种：BTREE和HASH，具体和表的存储引擎相关； MYISAM和InnoDB存储引擎
我的架构经验系列文章索引 agevs 架构
下面是一些个人架构上的总结，本来想只在公司内部进行共享的，因此内容写的口语化一点，也没什么图示，所有内容没有查任何资料是脑子里面的东西吐出来的因此可能会不准确不全，希望抛砖引玉，大家互相讨论。要注意，我这些文章是一个总体的架构经验不针对具体的语言和平台，因此也不一定是适用所有的语言和平台的。（内容是前几天写的，现附上索引）前端架构 http://www.
Android so lib库远程http下载和动态注册 aijuans andorid
一、背景在开发Android应用程序的实现，有时候需要引入第三方so lib库，但第三方so库比较大，例如开源第三方播放组件ffmpeg库, 如果直接打包的apk包里面, 整个应用程序会大很多.经过查阅资料和实验，发现通过远程下载so文件，然后再动态注册so文件时可行的。主要需要解决下载so文件存放位置以及文件读写权限问题。二、主要
linux中svn配置出错 conf/svnserve.conf:12: Option expected 解决方法 baalwolf option
在客户端访问subversion版本库时出现这个错误： svnserve.conf:12: Option expected 为什么会出现这个错误呢，就是因为subversion读取配置文件svnserve.conf时，无法识别有前置空格的配置文件，如### This file controls the configuration of the svnserve daemon, if you##
MongoDB的连接池和连接管理 BigCat2013 mongodb
在关系型数据库中，我们总是需要关闭使用的数据库连接，不然大量的创建连接会导致资源的浪费甚至于数据库宕机。这篇文章主要想解释一下mongoDB的连接池以及连接管理机制，如果正对此有疑惑的朋友可以看一下。通常我们习惯于new 一个connection并且通常在finally语句中调用connection的close()方法将其关闭。正巧，mongoDB中当我们new一个Mongo的时候，会发现它也
AngularJS使用Socket.IO bijian1013 JavaScript AngularJS Socket.IO
目前，web应用普遍被要求是实时web应用，即服务端的数据更新之后，应用能立即更新。以前使用的技术（例如polling）存在一些局限性，而且有时我们需要在客户端打开一个socket，然后进行通信。 Socket.IO(http://socket.io/)是一个非常优秀的库，它可以帮你实
[Maven学习笔记四]Maven依赖特性 bit1129 maven
三个模块为了说明问题，以用户登陆小web应用为例。通常一个web应用分为三个模块，模型和数据持久化层user-core, 业务逻辑层user-service以及web展现层user-web， user-service依赖于user-core user-web依赖于user-core和user-service 依赖作用范围 Maven的dependency定义
【Akka一】Akka入门 bit1129 akka
什么是Akka Message-Driven Runtime is the Foundation to Reactive Applications In Akka, your business logic is driven through message-based communication patterns that are independent of physical locatio
zabbix_api之perl语言写法 ronin47 zabbix_api之perl
zabbix_api网上比较多的写法是python或curl。上次我用java－－http://bossr.iteye.com/blog/2195679，这次用perl。for example: #!/usr/bin/perl use 5.010 ; use strict ; use warnings ; use JSON :: RPC :: Client ; use
比优衣库跟牛掰的视频流出了，兄弟连Linux运维工程师课堂实录，更加刺激，更加实在！ brotherlamp linux运维工程师 linux运维工程师教程 linux运维工程师视频 linux运维工程师资料 linux运维工程师自学
比优衣库跟牛掰的视频流出了，兄弟连Linux运维工程师课堂实录，更加刺激，更加实在！ ----------------------------------------------------- 兄弟连Linux运维工程师课堂实录-计算机基础-1-课程体系介绍1 链接：http://pan.baidu.com/s/1i3GQtGL 密码：bl65 兄弟连Lin
bitmap求哈密顿距离-给定N（1<=N<=100000）个五维的点A(x1,x2,x3,x4,x5)，求两个点X(x1,x2,x3,x4,x5)和Y( bylijinnan java
import java.util.Random; /** * 题目： * 给定N（1<=N<=100000）个五维的点A(x1,x2,x3,x4,x5)，求两个点X(x1,x2,x3,x4,x5)和Y(y1,y2,y3,y4,y5)， * 使得他们的哈密顿距离（d=|x1-y1| + |x2-y2| + |x3-y3| + |x4-y4| + |x5-y5|）最大
map的三种遍历方法 chicony map
package com.test; import java.util.Collection; import java.util.HashMap; import java.util.Iterator; import java.util.Map; import java.util.Set; public class TestMap { public static v
Linux安装mysql的一些坑 chenchao051 linux
1、mysql不建议在root用户下运行 2、出现服务启动不了，111错误，注意要用chown来赋予权限，我在root用户下装的mysql，我就把usr/share/mysql/mysql.server复制到/etc/init.d/mysqld, (同时把my-huge.cnf复制/etc/my.cnf) chown -R cc /etc/init.d/mysql
Sublime Text 3 配置 daizj 配置 Sublime Text
Sublime Text 3 配置解释(默认){// 设置主题文件“color_scheme”: “Packages/Color Scheme – Default/Monokai.tmTheme”,// 设置字体和大小“font_face”: “Consolas”,“font_size”: 12,// 字体选项：no_bold不显示粗体字，no_italic不显示斜体字，no_antialias和
MySQL server has gone away 问题的解决方法 dcj3sjt126com SQL Server
MySQL server has gone away 问题解决方法，需要的朋友可以参考下。应用程序（比如PHP）长时间的执行批量的MYSQL语句。执行一个SQL，但SQL语句过大或者语句中含有BLOB或者longblob字段。比如，图片数据的处理。都容易引起MySQL server has gone away。今天遇到类似的情景，MySQL只是冷冷的说：MySQL server h
javascript/dom:固定居中效果 dcj3sjt126com JavaScript
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&
使用 Spring 2.5 注释驱动的 IoC 功能 e200702084 spring bean 配置管理 IOC Office
使用 Spring 2.5 注释驱动的 IoC 功能 developerWorks 文档选项将打印机的版面设置成横向打印模式打印本页将此页作为电子邮件发送将此页作为电子邮件发送级别：初级陈雄华 ([email protected]), 技术总监, 宝宝淘网络科技有限公司 2008 年 2 月 28 日 &nb
MongoDB常用操作命令 geeksun mongodb
1. 基本操作 db.AddUser(username,password) 添加用户 db.auth(usrename,password) 设置数据库连接验证 db.cloneDataBase(fromhost)
php写守护进程（Daemon） hongtoushizi PHP
转载自： http://blog.csdn.net/tengzhaorong/article/details/9764655 守护进程（Daemon）是运行在后台的一种特殊进程。它独立于控制终端并且周期性地执行某种任务或等待处理某些发生的事件。守护进程是一种很有用的进程。php也可以实现守护进程的功能。 1、基本概念 &nbs
spring整合mybatis,关于注入Dao对象出错问题 jonsvien DAO spring bean mybatis prototype
今天在公司测试功能时发现一问题：先进行代码说明： 1，controller配置了Scope="prototype"（表明每一次请求都是原子型） @resource/@autowired service对象都可以（两种注解都可以）。 2，service 配置了Scope="prototype"（表明每一次请求都是原子型）
对象关系行为模式之标识映射 home198979 PHP 架构企业应用对象关系标识映射
HELLO!架构一、概念 identity Map:通过在映射中保存每个已经加载的对象，确保每个对象只加载一次，当要访问对象的时候，通过映射来查找它们。其实在数据源架构模式之数据映射器代码中有提及到标识映射，Mapper类的getFromMap方法就是实现标识映射的实现。二、为什么要使用标识映射？在数据源架构模式之数据映射器中 //c
Linux下hosts文件详解 pda158 linux
　1、主机名：　　无论在局域网还是INTERNET上，每台主机都有一个IP地址，是为了区分此台主机和彼台主机，也就是说IP地址就是主机的门牌号。　　公网：IP地址不方便记忆，所以又有了域名。域名只是在公网（INtERNET)中存在，每个域名都对应一个IP地址，但一个IP地址可有对应多个域名。　　局域网：每台机器都有一个主机名，用于主机与主机之间的便于区分，就可以为每台机器设置主机
nginx配置文件粗解 spjich java nginx
#运行用户#user nobody;#启动进程,通常设置成和cpu的数量相等worker_processes 2;#全局错误日志及PID文件#error_log logs/error.log;#error_log logs/error.log notice;#error_log logs/error.log inf
数学函数 w54653520 java
public class S { // 传入两个整数，进行比较，返回两个数中的最大值的方法。 public int get( int num1, int nu