peihaozhu

July大神---SVM讲解

支持向量机通俗导论（理解SVM的三层境界）

作者： July ；致谢： pluskid、白石、J erryLead。
出处：结构之法算法之道 blog 。

前言

动笔写这个支持向量机(support vector machine)是费了不少劲和困难的，原因很简单，一者这个东西本身就并不好懂，要深入学习和研究下去需花费不少时间和精力，二者这个东西也不好讲清楚，尽管网上已经有朋友写得不错了(见文末参考链接)，但在描述数学公式的时候还是显得不够。得益于同学白石的数学证明，我还是想尝试写一下，希望本文在兼顾通俗易懂的基础上，真真正正能足以成为一篇完整概括和介绍支持向量机的导论性的文章。

本文在写的过程中，参考了不少资料，包括《支持向量机导论》、《统计学习方法》及网友pluskid的支持向量机系列等等，于此，还是一篇学习笔记，只是加入了自己的理解和总结，有任何不妥之处，还望海涵。全文宏观上整体认识支持向量机的概念和用处，微观上深究部分定理的来龙去脉，证明及原理细节，力保逻辑清晰 & 通俗易懂。

同时，阅读本文时建议大家尽量使用chrome等浏览器，如此公式才能更好的显示，再者，阅读时可拿张纸和笔出来，把本文所有定理.公式都亲自推导一遍或者直接打印下来（可直接打印网页版或本文文末附的PDF，享受随时随地思考、演算的极致快感），在文稿上演算。

Ok，还是那句原话，有任何问题，欢迎任何人随时不吝指正 & 赐教，感谢。

第一层、了解SVM

支持向量机，因其英文名为support vector machine，故一般简称SVM，通俗来讲，它是一种二类分类模型，其基本模型定义为特征空间上的间隔最大的线性分类器，其学习策略便是间隔最大化，最终可转化为一个凸二次规划问题的求解。

1.1、分类标准的起源：Logistic回归

理解SVM，咱们必须先弄清楚一个概念：线性分类器。

给定一些数据点，它们分别属于两个不同的类，现在要找到一个线性分类器把这些数据分成两类。如果用x表示数据点，用y表示类别（y可以取1或者-1，分别代表两个不同的类），一个线性分类器的学习目标便是要在n维的数据空间中找到一个超平面（hyper plane），这个超平面的方程可以表示为（ wT中的T代表转置）：

可能有读者对类别取1或-1有疑问，事实上，这个1或-1的分类标准起源于logistic回归。

Logistic回归目的是从特征学习出一个0/1分类模型，而这个模型是将特性的线性组合作为自变量，由于自变量的取值范围是负无穷到正无穷。因此，使用logistic函数（或称作sigmoid函数）将自变量映射到(0,1)上，映射后的值被认为是属于y=1的概率。

假设函数

其中x是n维特征向量，函数g就是logistic函数。

而

的图像是

可以看到，将无穷映射到了(0,1)。

而假设函数就是特征属于y=1的概率。

从而，当我们要判别一个新来的特征属于哪个类时，只需求即可，若大于0.5就是y=1的类，反之属于y=0类。

此外，只和有关，>0，那么，而g(z)只是用来映射，真实的类别决定权还是在于。再者，当时，=1，反之=0。如果我们只从出发，希望模型达到的目标就是让训练数据中y=1的特征，而是y=0的特征。Logistic回归就是要学习得到，使得正例的特征远大于0，负例的特征远小于0，而且要在全部训练实例上达到这个目标。

接下来，尝试把logistic回归做个变形。首先，将使用的结果标签y = 0和y = 1替换为y = -1,y = 1，然后将（）中的替换为b，最后将后面的替换为（即）。如此，则有了。也就是说除了y由y=0变为y=-1外，线性分类函数跟logistic回归的形式化表示没区别。

进一步，可以将假设函数中的g(z)做一个简化，将其简单映射到y=-1和y=1上。映射关系如下：

1.2、线性分类的一个例子

下面举个简单的例子，如下图所示，现在有一个二维平面，平面上有两种不同的数据，分别用圈和叉表示。由于这些数据是线性可分的，所以可以用一条直线将这两类数据分开，这条直线就相当于一个超平面，超平面一边的数据点所对应的y全是 -1 ，另一边所对应的y全是1。

这个超平面可以用分类函数表示，当f(x) 等于0的时候，x便是位于超平面上的点，而f(x)大于0的点对应 y=1 的数据点，f(x)小于0的点对应y=-1的点，如下图所示：

注：有的资料上定义特征到结果的输出函数

，与这里定义的

实质是一样的。为什么？因为无论是

，还是

，不影响最终优化结果。下文你将看到，当我们转化到优化

的时候，为了求解方便，会把yf(x)令为1，即yf(x)是y(w^x + b)，还是y(w^x - b)，对我们要优化的式子max1/||w||已无影响。

（有一朋友飞狗来自Mare_Desiderii，看了上面的定义之后，问道：请教一下SVM functional margin 为=y(wTx+b)=yf(x)中的Y是只取1和-1 吗？y的唯一作用就是确保functional margin的非负性？真是这样的么？当然不是，详情请见本文评论下第43楼）

当然，有些时候，或者说大部分时候数据并不是线性可分的，这个时候满足这样条件的超平面就根本不存在(不过关于如何处理这样的问题我们后面会讲)，这里先从最简单的情形开始推导，就假设数据都是线性可分的，亦即这样的超平面是存在的。

换言之，在进行分类的时候，遇到一个新的数据点x，将x代入f(x) 中，如果f(x)小于0则将x的类别赋为-1，如果f(x)大于0则将x的类别赋为1。

接下来的问题是，如何确定这个超平面呢？从直观上而言，这个超平面应该是最适合分开两类数据的直线。而判定“最适合”的标准就是这条直线离直线两边的数据的间隔最大。所以，得寻找有着最大间隔的超平面。

1.3、函数间隔Functional margin与几何间隔Geometrical margin

在超平面w*x+b=0确定的情况下，|w*x+b|能够表示点x到距离超平面的远近，而通过观察w*x+b的符号与类标记y的符号是否一致可判断分类是否正确，所以，可以用(y*(w*x+b))的正负性来判定或表示分类的正确性。于此，我们便引出了函数间隔（functional margin）的概念。

定义函数间隔（用表示）为：

而超平面(w，b)关于T中所有样本点(xi，yi)的函数间隔最小值（其中，x是特征，y是结果标签，i表示第i个样本），便为超平面(w, b)关于训练数据集T的函数间隔：

= mini (i=1，...n)

但这样定义的函数间隔有问题，即如果成比例的改变w和b（如将它们改成2w和2b），则函数间隔的值f(x)却变成了原来的2倍（虽然此时超平面没有改变），所以只有函数间隔还远远不够。

事实上，我们可以对法向量w加些约束条件，从而引出真正定义点到超平面的距离--几何间隔（geometrical margin）的概念。

假定对于一个点 x ，令其垂直投影到超平面上的对应点为 x0 ，w 是垂直于超平面的一个向量，为样本x到分类间隔的距离，如下图所示：

有，其中||w||表示的是范数。

又由于 x0 是超平面上的点，满足 f(x0)=0 ，代入超平面的方程即可算出：

（有的书上会写成把||w|| 分开相除的形式，如本文参考文献及推荐阅读条目11，其中，||w||为w的二阶泛数）

为了得到的绝对值，令乘上对应的类别 y，即可得出几何间隔（用表示）的定义：

从上述函数间隔和几何间隔的定义可以看出：几何间隔就是函数间隔除以||w||，而且函数间隔y*(wx+b) = y*f(x)实际上就是|f(x)|，只是人为定义的一个间隔度量，而几何间隔|f(x)|/||w||才是直观上的点到超平面的距离。

1.4、最大间隔分类器Maximum Margin Classifier的定义

对一个数据点进行分类，当超平面离数据点的“间隔”越大，分类的确信度（confidence）也越大。所以，为了使得分类的确信度尽量高，需要让所选择的超平面能够最大化这个“间隔”值。这个间隔如下图中的gap / 2所示。

通过由前面的分析可知：函数间隔不适合用来最大化间隔值，因为在超平面固定以后，可以等比例地缩放w的长度和b的值，这样可以使得的值任意大，亦即函数间隔可以在超平面保持不变的情况下被取得任意大。但几何间隔因为除上了，使得在缩放w和b的时候几何间隔的值是不会改变的，它只随着超平面的变动而变动，因此，这是更加合适的一个间隔。所以，这里要找的最大间隔分类超平面中的“间隔”指的是几何间隔。

于是最大间隔分类器（maximum margin classifier）的目标函数可以定义为：

同时需满足一些条件，根据间隔的定义，有

其中，s.t.，即subject to的意思，它导出的是约束条件。

回顾下几何间隔的定义可知：如果令函数间隔等于1（之所以令等于1，是为了方便推导和优化，且这样做对目标函数的优化没有影响，至于为什么，请见本文评论下第42楼回复），则有 = 1 / ||w||且，从而上述目标函数转化成了

这个目标函数便是在相应的约束条件下，最大化这个1/||w||值，而1/||w||便是几何间隔。

如下图所示，中间的实线便是寻找到的最优超平面（Optimal Hyper Plane），其到两条虚线的距离相等，这个距离便是几何间隔，两条虚线之间的距离等于2，而虚线上的点则是支持向量。由于这些支持向量刚好在边界上，所以它们满足（还记得我们把 functional margin 定为 1 了吗？上节中：处于方便推导和优化的目的，我们可以令=1），而对于所有不是支持向量的点，则显然有。

OK，到此为止，算是了解到了SVM的第一层，对于那些只关心怎么用SVM的朋友便已足够，不必再更进一层深究其更深的原理。

第二层、深入SVM

2.1、从线性可分到线性不可分

2.1.1、从原始问题到对偶问题的求解

接着考虑之前得到的目标函数：

由于求

的最大值相当于求

的最小值，所以上述目标函数等价于（w由分母变成分子，从而也有原来的max问题变为min问题，很明显，两者问题等价）：

因为现在的目标函数是二次的，约束条件是线性的，所以它是一个凸二次规划问题。这个问题可以用现成的QP (Quadratic Programming) 优化包进行求解。一言以蔽之：在一定的约束条件下，目标最优，损失最小。

此外，由于这个问题的特殊结构，还可以通过拉格朗日对偶性（Lagrange Duality）变换到对偶变量 (dual variable) 的优化问题，即通过求解与原问题等价的对偶问题（dual problem）得到原始问题的最优解，这就是线性可分条件下支持向量机的对偶算法，这样做的优点在于：一者对偶问题往往更容易求解；二者可以自然的引入核函数，进而推广到非线性分类问题。

那什么是拉格朗日对偶性呢？简单来讲，通过给每一个约束条件加上一个拉格朗日乘子（Lagrange multiplier），定义拉格朗日函数（通过拉格朗日函数将约束条件融合到目标函数里去，从而只用一个函数表达式便能清楚的表达出我们的问题）：

然后令

容易验证，当某个约束条件不满足时，例如，那么显然有（只要令即可）。而当所有约束条件都满足时，则最优值为，亦即最初要最小化的量。

因此，在要求约束条件得到满足的情况下最小化，实际上等价于直接最小化（当然，这里也有约束条件，就是 ≥0,i=1,…,n ），因为如果约束条件没有得到满足，会等于无穷大，自然不会是我们所要求的最小值。

具体写出来，目标函数变成了：

这里用表示这个问题的最优值，且和最初的问题是等价的。如果直接求解，那么一上来便得面对w和b两个参数，而又是不等式约束，这个求解过程不好做。不妨把最小和最大的位置交换一下，变成：

交换以后的新问题是原始问题的对偶问题，这个新问题的最优值用来表示。而且有≤，在满足某些条件的情况下，这两者相等，这个时候就可以通过求解对偶问题来间接地求解原始问题。

换言之，之所以从minmax的原始问题，转化为maxmin的对偶问题，一者因为是的近似解，二者，转化为对偶问题后，更容易求解。

下面可以先求L 对w、b的极小，再求L 对的极大。

2.1.2、KKT条件

上文中提到“≤在满足某些条件的情况下，两者等价”，这所谓的“满足某些条件”就是要满足KKT条件。

一般地，一个最优化数学模型能够表示成下列标准形式：

其中，f(x)是需要最小化的函数，h(x)是等式约束，g(x)是不等式约束，p和q分别为等式约束和不等式约束的数量。

同时，得明白以下两点：

凸优化的概念：为一凸集，为一凸函数。凸优化就是要找出一点，使得每一满足。
KKT条件的意义：它是一个非线性规划（Nonlinear Programming）问题能有最优化解法的必要和充分条件。

而KKT条件就是指上面最优化数学模型的标准形式中的最小点 x* 必须满足下面的条件：

经过论证，我们这里的问题是满足 KKT 条件的（首先已经满足Slater condition，再者f和gi也都是可微的，即L对w和b都可导），因此现在我们便转化为求解第二个问题。

也就是说，原始问题通过满足KKT条件，已经转化成了对偶问题。而求解这个对偶学习问题，分为3个步骤：首先要让L(w，b，a) 关于 w 和 b 最小化，然后求对的极大，最后利用SMO算法求解对偶问题中的拉格朗日乘子。

2.1.3、对偶问题求解的3个步骤

（1）、首先固定，要让 L 关于 w 和 b 最小化，我们分别对w，b求偏导数，即令 ∂L/∂w 和 ∂L/∂b 等于零（对w求导结果的解释请看本文评论下第45楼回复）：

将以上结果代入之前的L ：

得到：

提醒：有读者可能会问上述推导过程如何而来？说实话，其具体推导过程是比较复杂的，如下图所示：

最后，得到：

如 jerrylead所说：“倒数第4步”推导到“倒数第3步”使用了线性代数的转置运算，由于ai和yi都是实数，因此转置后与自身一样。“倒数第3步”推导到“倒数第2步”使用了(a+b+c+…)(a+b+c+…)=aa+ab+ac+ba+bb+bc+…的乘法运算法则。最后一步是上一步的顺序调整。

L (

从上面的最后一个式子，我们可以看出，此时的拉格朗日函数只包含了一个变量，那就是（求出了便能求出w，和b，由此可见，上文第1.2节提出来的核心问题：分类函数也就可以轻而易举的求出来了）。

（2）、求对的极大，即是关于对偶问题的最优化问题。经过上面第一个步骤的求w和b，得到的拉格朗日函数式子已经没有了变量w，b，只有。从上面的式子得到：

这样，求出了

，根据

，即可求出w，然后通过

，即可求出b，最终得出分离超平面和分类决策函数。

（3）在求得L(w, b, a) 关于 w 和 b 最小化，以及对的极大之后，最后一步则可以利用SMO算法求解对偶问题中的拉格朗日乘子。

上述式子要解决的是在参数

上求最大值W的问题，至于

和

都是已知数。要了解这个SMO算法是如何推导的，请跳到下文第3.5节、SMO算法。

到目前为止，我们的 SVM 还比较弱，只能处理线性的情况，下面我们将引入核函数，进而推广到非线性分类问题。

2.1.5、线性不可分的情况

OK，为过渡到下节2.2节所介绍的核函数，让我们再来看看上述推导过程中得到的一些有趣的形式。首先就是关于我们的 hyper plane ，对于一个数据点 x 进行分类，实际上是通过把 x 带入到算出结果然后根据其正负号来进行类别划分的。而前面的推导中我们得到

因此分类函数为：

这里的形式的有趣之处在于，对于新点 x的预测，只需要计算它与训练数据点的内积即可（表示向量内积），这一点至关重要，是之后使用 Kernel 进行非线性推广的基本前提。此外，所谓 Supporting Vector 也在这里显示出来——事实上，所有非Supporting Vector 所对应的系数都是等于零的，因此对于新点的内积计算实际上只要针对少量的“支持向量”而不是所有的训练数据即可。

为什么非支持向量对应的等于零呢？直观上来理解的话，就是这些“后方”的点——正如我们之前分析过的一样，对超平面是没有影响的，由于分类完全有超平面决定，所以这些无关的点并不会参与分类问题的计算，因而也就不会产生任何影响了。

回忆一下我们2.1.1节中通过 Lagrange multiplier得到的目标函数：

注意到如果 xi 是支持向量的话，上式中红颜色的部分是等于 0 的（因为支持向量的 functional margin 等于 1 ），而对于非支持向量来说，functional margin 会大于 1 ，因此红颜色部分是大于零的，而又是非负的，为了满足最大化，必须等于 0 。这也就是这些非Supporting Vector 的点的局限性。

从1.5节到上述所有这些东西，便得到了一个maximum margin hyper plane classifier，这就是所谓的支持向量机（Support Vector Machine）。当然，到目前为止，我们的 SVM 还比较弱，只能处理线性的情况，不过，在得到了对偶dual 形式之后，通过 Kernel 推广到非线性的情况就变成了一件非常容易的事情了(相信，你还记得本节开头所说的：“通过求解对偶问题得到最优解，这就是线性可分条件下支持向量机的对偶算法，这样做的优点在于：一者对偶问题往往更容易求解；二者可以自然的引入核函数，进而推广到非线性分类问题”)。

2.2、核函数Kernel

2.2.1、特征空间的隐式映射：核函数

咱们首先给出核函数的来头：在上文中，我们已经了解到了SVM处理线性可分的情况，而对于非线性的情况，SVM 的处理方法是选择一个核函数 κ(⋅,⋅) ，通过将数据映射到高维空间，来解决在原始空间中线性不可分的问题。

此外，因为训练样例一般是不会独立出现的，它们总是以成对样例的内积形式出现，而用对偶形式表示学习器的优势在为在该表示中可调参数的个数不依赖输入属性的个数，通过使用恰当的核函数来替代内积，可以隐式得将非线性的训练数据映射到高维空间，而不增加可调参数的个数(当然，前提是核函数能够计算对应着两个输入特征向量的内积)。

在线性不可分的情况下，支持向量机首先在低维空间中完成计算，然后通过核函数将输入空间映射到高维特征空间，最终在高维特征空间中构造出最优分离超平面，从而把平面上本身不好分的非线性数据分开。如图7-7所示，一堆数据在二维空间无法划分，从而映射到三维空间里划分：

而在我们遇到核函数之前，如果用原始的方法，那么在用线性学习器学习一个非线性关系，需要选择一个非线性特征集，并且将数据写成新的表达形式，这等价于应用一个固定的非线性映射，将数据映射到特征空间，在特征空间中使用线性学习器，因此，考虑的假设集是这种类型的函数：

这里 ϕ：X->F是从输入空间到某个特征空间的映射，这意味着建立非线性学习器分为两步：

首先使用一个非线性映射将数据变换到一个特征空间F，
然后在特征空间使用线性学习器分类。

而由于对偶形式就是线性学习器的一个重要性质，这意味着假设可以表达为训练点的线性组合，因此决策规则可以用测试点和训练点的内积来表示：

如果有一种方式可以 在特征空间中直接计算内积〈φ(x_i · φ(x) 〉，就像在原始输入点的函数中一样，就有可能将两个步骤融合到一起建立一个非线性的学习器，这样直接计算法的方法称为核函数方法：

核是一个函数K，对所有x，z(-X，满足

，这里 φ是从X到内积特征空间F的映射。

2.2.2、核函数：如何处理非线性数据

来看个核函数的例子。如下图所示的两类数据，分别分布为两个圆圈的形状，这样的数据本身就是线性不可分的，此时咱们该如何把这两类数据分开呢(下文将会有一个相应的三维空间图)？

事实上，上图所述的这个数据集，是用两个半径不同的圆圈加上了少量的噪音生成得到的，所以，一个理想的分界应该是一个“圆圈”而不是一条线（超平面）。如果用 X1 和 X2 来表示这个二维平面的两个坐标的话，我们知道一条二次曲线（圆圈是二次曲线的一种特殊情况）的方程可以写作这样的形式：

注意上面的形式，如果我们构造另外一个五维的空间，其中五个坐标的值分别为 Z1=X1 , Z2=X21 , Z3=X2 , Z4=X22 , Z5=X1X2 ，那么显然，上面的方程在新的坐标系下可以写作：

关于新的坐标 Z ，这正是一个 hyper plane 的方程！也就是说，如果我们做一个映射 ϕ:R2→R5 ，将 X 按照上面的规则映射为 Z ，那么在新的空间中原来的数据将变成线性可分的，从而使用之前我们推导的线性分类算法就可以进行处理了。这正是 Kernel 方法处理非线性问题的基本思想。

再进一步描述 Kernel 的细节之前，不妨再来看看这个例子映射过后的直观例子。当然，你我可能无法把 5 维空间画出来，不过由于我这里生成数据的时候就是用了特殊的情形，具体来说，我这里的超平面实际的方程是这个样子（圆心在 X2 轴上的一个正圆）：

因此我只需要把它映射到 Z1=X21 , Z2=X22 , Z3=X2 这样一个三维空间中即可，下图即是映射之后的结果，将坐标轴经过适当的旋转，就可以很明显地看出，数据是可以通过一个平面来分开的(pluskid：下面的gif 动画，先用 Matlab 画出一张张图片，再用 Imagemagick 拼贴成)：

核函数相当于把原来的分类函数：

映射成：

而其中的可以通过求解如下 dual 问题而得到的：

这样一来问题就解决了吗？似乎是的：拿到非线性数据，就找一个映射，然后一股脑把原来的数据映射到新空间中，再做线性 SVM 即可。不过事实上没有这么简单！其实刚才的方法稍想一下就会发现有问题：在最初的例子里，我们对一个二维空间做映射，选择的新空间是原始空间的所有一阶和二阶的组合，得到了五个维度；如果原始空间是三维，那么我们会得到 19 维的新空间，这个数目是呈爆炸性增长的，这给的计算带来了非常大的困难，而且如果遇到无穷维的情况，就根本无从计算了。所以就需要 Kernel 出马了。

不妨还是从最开始的简单例子出发，设两个向量和，而即是到前面说的五维空间的映射，因此映射过后的内积为：

（公式说明：上面的这两个推导过程中，所说的前面的五维空间的映射，这里说的前面便是文中2.2.1节的所述的映射方式，回顾下之前的映射规则，再看那第一个推导，其实就是计算x1，x2各自的内积，然后相乘相加即可，第二个推导则是直接平方，去掉括号，也很容易推出来）

另外，我们又注意到：

二者有很多相似的地方，实际上，我们只要把某几个维度线性缩放一下，然后再加上一个常数维度，具体来说，上面这个式子的计算结果实际上和映射

之后的内积的结果是相等的，那么区别在于什么地方呢？

一个是映射到高维空间中，然后再根据内积的公式进行计算；
而另一个则直接在原来的低维空间中进行计算，而不需要显式地写出映射后的结果。

（公式说明：上面之中，最后的两个式子，第一个算式，是带内积的完全平方式，可以拆开，然后，通过凑一个得到，第二个算式，也是根据第一个算式凑出来的）

回忆刚才提到的映射的维度爆炸，在前一种方法已经无法计算的情况下，后一种方法却依旧能从容处理，甚至是无穷维度的情况也没有问题。

我们把这里的计算两个向量在隐式映射过后的空间中的内积的函数叫做核函数 (Kernel Function) ，例如，在刚才的例子中，我们的核函数为：

核函数能简化映射空间中的内积运算——刚好“碰巧”的是，在我们的 SVM 里需要计算的地方数据向量总是以内积的形式出现的。对比刚才我们上面写出来的式子，现在我们的分类函数为：

其中由如下 dual 问题计算而得：

这样一来计算的问题就算解决了，避开了直接在高维空间中进行计算，而结果却是等价的！当然，因为我们这里的例子非常简单，所以我可以手工构造出对应于的核函数出来，如果对于任意一个映射，想要构造出对应的核函数就很困难了。

2.2.3、几个核函数

通常人们会从一些常用的核函数中选择（根据问题和数据的不同，选择不同的参数，实际上就是得到了不同的核函数），例如：

多项式核，显然刚才我们举的例子是这里多项式核的一个特例（R = 1，d = 2）。虽然比较麻烦，而且没有必要，不过这个核所对应的映射实际上是可以写出来的，该空间的维度是，其中是原始空间的维度。
高斯核，这个核就是最开始提到过的会将原始空间映射为无穷维空间的那个家伙。不过，如果选得很大的话，高次特征上的权重实际上衰减得非常快，所以实际上（数值上近似一下）相当于一个低维的子空间；反过来，如果选得很小，则可以将任意的数据映射为线性可分——当然，这并不一定是好事，因为随之而来的可能是非常严重的过拟合问题。不过，总的来说，通过调控参数，高斯核实际上具有相当高的灵活性，也是使用最广泛的核函数之一。下图所示的例子便是把低维线性不可分的数据通过高斯核函数映射到了高维空间：
线性核，这实际上就是原始空间中的内积。这个核存在的主要目的是使得“映射后空间中的问题”和“映射前空间中的问题”两者在形式上统一起来了(意思是说，咱们有的时候，写代码，或写公式的时候，只要写个模板或通用表达式，然后再代入不同的核，便可以了，于此，便在形式上统一了起来，不用再分别写一个线性的，和一个非线性的)。

2.2.4、核函数的本质

上面说了这么一大堆，读者可能还是没明白核函数到底是个什么东西？我再简要概括下，即以下三点：

实际中，我们会经常遇到线性不可分的样例，此时，我们的常用做法是把样例特征映射到高维空间中去(如上文2.2节最开始的那幅图所示，映射到高维空间后，相关特征便被分开了，也就达到了分类的目的)；
但进一步，如果凡是遇到线性不可分的样例，一律映射到高维空间，那么这个维度大小是会高到可怕的(如上文中19维乃至无穷维的例子)。那咋办呢？
此时，核函数就隆重登场了，核函数的价值在于它虽然也是讲特征进行从低维到高维的转换，但核函数绝就绝在它事先在低维上进行计算，而将实质上的分类效果表现在了高维上，也就如上文所说的避免了直接在高维空间中的复杂计算。

最后引用这里的一个例子举例说明下核函数解决非线性问题的直观效果。

假设现在你是一个农场主，圈养了一批羊群，但为预防狼群袭击羊群，你需要搭建一个篱笆来把羊群围起来。但是篱笆应该建在哪里呢？你很可能需要依据牛群和狼群的位置建立一个“分类器”，比较下图这几种不同的分类器，我们可以看到SVM完成了一个很完美的解决方案。

这个例子从侧面简单说明了SVM使用非线性分类器的优势，而逻辑模式以及决策树模式都是使用了直线方法。

OK，不再做过多介绍了，对核函数有进一步兴趣的，还可以看看此文。

2.3、使用松弛变量处理 outliers 方法

在本文第一节最开始讨论支持向量机的时候，我们就假定，数据是线性可分的，亦即我们可以找到一个可行的超平面将数据完全分开。后来为了处理非线性数据，在上文2.2节使用 Kernel 方法对原来的线性 SVM 进行了推广，使得非线性的的情况也能处理。虽然通过映射将原始数据映射到高维空间之后，能够线性分隔的概率大大增加，但是对于某些情况还是很难处理。

例如可能并不是因为数据本身是非线性结构的，而只是因为数据有噪音。对于这种偏离正常位置很远的数据点，我们称之为 outlier ，在我们原来的 SVM 模型里，outlier 的存在有可能造成很大的影响，因为超平面本身就是只有少数几个 support vector 组成的，如果这些 support vector 里又存在 outlier 的话，其影响就很大了。例如下图：

用黑圈圈起来的那个蓝点是一个 outlier ，它偏离了自己原本所应该在的那个半空间，如果直接忽略掉它的话，原来的分隔超平面还是挺好的，但是由于这个 outlier 的出现，导致分隔超平面不得不被挤歪了，变成途中黑色虚线所示（这只是一个示意图，并没有严格计算精确坐标），同时 margin 也相应变小了。当然，更严重的情况是，如果这个 outlier 再往右上移动一些距离的话，我们将无法构造出能将数据分开的超平面来。

为了处理这种情况，SVM 允许数据点在一定程度上偏离一下超平面。例如上图中，黑色实线所对应的距离，就是该 outlier 偏离的距离，如果把它移动回来，就刚好落在原来的超平面上，而不会使得超平面发生变形了。

插播下一位读者@Copper_PKU的理解：“换言之，在有松弛的情况下outline点也属于支持向量SV，同时，对于不同的支持向量，拉格朗日参数的值也不同，如此篇论文《Large Scale Machine Learning》中的下图所示：

对于远离分类平面的点值为0；对于边缘上的点值在[0, 1/L]之间，其中，L为训练数据集个数，即数据集大小；对于outline数据和内部的数据值为1/L。更多请参看本文文末参考条目第51条。”

OK，继续回到咱们的问题。我们，原来的约束条件为：

现在考虑到outlier问题，约束条件变成了：

其中称为松弛变量 (slack variable) ，对应数据点允许偏离的 functional margin 的量。当然，如果我们运行任意大的话，那任意的超平面都是符合条件的了。所以，我们在原来的目标函数后面加上一项，使得这些的总和也要最小：

其中是一个参数，用于控制目标函数中两项（“寻找 margin 最大的超平面”和“保证数据点偏差量最小”）之间的权重。注意，其中是需要优化的变量（之一），而是一个事先确定好的常量。完整地写出来是这个样子：

用之前的方法将限制或约束条件加入到目标函数中，得到新的拉格朗日函数，如下所示：

分析方法和前面一样，转换为另一个问题之后，我们先让针对、和最小化：

将带回并化简，得到和原来一样的目标函数：

不过，由于我们得到而又有（作为 Lagrange multiplier 的条件），因此有，所以整个 dual 问题现在写作：

把前后的结果对比一下（错误修正：图中的Dual formulation中的Minimize应为maxmize）：

可以看到唯一的区别就是现在 dual variable

多了一个上限

。而 Kernel 化的非线性形式也是一样的，只要把

换成

即可。这样一来，一个完整的，可以处理线性和非线性并能容忍噪音和 outliers 的支持向量机才终于介绍完毕了。

行文至此，可以做个小结，不准确的说，SVM它本质上即是一个分类方法，用w^T+b定义分类函数，于是求w、b，为寻最大间隔，引出1/2||w||^2，继而引入拉格朗日因子，化为对拉格朗日乘子a的求解（求解过程中会涉及到一系列最优化或凸二次规划等问题），如此，求w.b与求a等价，而a的求解可以用一种快速学习算法SMO，至于核函数，是为处理非线性情况，若直接映射到高维计算恐维度爆炸，故在低维计算，等效高维表现。

OK，理解到这第二层，已经能满足绝大部分人一窥SVM原理的好奇心，然对于那些想在证明层面理解SVM的则还很不够，但进入第三层理解境界之前，你必须要有比较好的数理基础和逻辑证明能力，不然你会跟我一样，吃不少苦头的。

第三层、证明SVM

说实话，凡是涉及到要证明的东西.理论，便一般不是怎么好惹的东西。绝大部分时候，看懂一个东西不难，但证明一个东西则需要点数学功底，进一步，证明一个东西也不是特别难，难的是从零开始发明创造这个东西的时候，则显艰难(因为任何时代，大部分人的研究所得都不过是基于前人的研究成果，前人所做的是开创性工作，而这往往是最艰难最有价值的，他们被称为真正的先驱。牛顿也曾说过，他不过是站在巨人的肩上。你，我则更是如此)。

正如陈希孺院士在他的著作《数理统计学简史》的第4章、最小二乘法中所讲：在科研上诸多观念的革新和突破是有着很多的不易的，或许某个定理在某个时期由某个人点破了，现在的我们看来一切都是理所当然，但在一切没有发现之前，可能许许多多的顶级学者毕其功于一役，耗尽一生，努力了几十年最终也是无功而返。

话休絮烦，要证明一个东西先要弄清楚它的根基在哪，即构成它的基础是哪些理论。OK，以下内容基本是上文中未讲到的一些定理的证明，包括其背后的逻辑、来源背景等东西，还是读书笔记。

本部分导述

3.1节线性学习器中，主要阐述感知机算法；
3.2节非线性学习器中，主要阐述mercer定理；
3.3节、损失函数；
3.4节、最小二乘法；
3.5节、SMO算法；
3.6节、简略谈谈SVM的应用；

3.1、线性学习器

3.1.1、感知机算法

这个感知机算法是1956年提出的，年代久远，依然影响着当今，当然，可以肯定的是，此算法亦非最优，后续会有更详尽阐述。不过，有一点，你必须清楚，这个算法是为了干嘛的：不断的训练试错以期寻找一个合适的超平面( 是的，就这么简单)。

下面，举个例子。如下图所示，凭我们的直觉可以看出，图中的红线是最优超平面，蓝线则是根据感知机算法在不断的训练中，最终，若蓝线能通过不断的训练移动到红线位置上，则代表训练成功。

既然需要通过不断的训练以让蓝线最终成为最优分类超平面，那么，到底需要训练多少次呢？Novikoff定理告诉我们当间隔是正的时候感知机算法会在有限次数的迭代中收敛，也就是说Novikoff定理证明了感知机算法的收敛性，即能得到一个界，不至于无穷循环下去。

Novikoff定理：如果分类超平面存在, 仅需在序列上迭代几次，在界为的错误次数下就可以找到分类超平面，算法停止。

这里

，

为扩充间隔。根据误分次数公式可知, 迭代次数与对应于扩充(包括偏置)权重的训练集的间隔有关。

顺便再解释下这个所谓的扩充间隔

，

即为样本到分类间隔的距离，即从

引出的最大分类间隔。OK，还记得上文第1.3.2节开头的内容么？如下： “

在给出几何间隔的定义之前，咱们首先来看下，如上图所示，对于一个点 x ，令其垂直投影到超平面上的对应的为 x0 ，由于 w 是垂直于超平面的一个向量，为样本x到分类间隔的距离，我们有

”

然后后续怎么推导出最大分类间隔请回到本文第一、二部分，此处不重复板书。

同时有一点得注意：感知机算法虽然可以通过简单迭代对线性可分数据生成正确分类的超平面，但不是最优效果，那怎样才能得到最优效果呢，就是上文中第一部分所讲的寻找最大分类间隔超平面。此外，Novikoff定理的证明请见这里。

3.2、非线性学习器

3.2.1、Mercer定理

Mercer定理：如果函数K是

上的映射（也就是从两个n维向量映射到实数域）。那么如果K是一个有效核函数（也称为Mercer核函数），那么当且仅当对于训练样例

，其相应的核函数矩阵是对称半正定的。

要理解这个Mercer 定理，先要了解什么是半正定矩阵，要了解什么是半正定矩阵，先得知道什么是正定矩阵（矩阵理论“博大精深”，我自己也未能彻底理清，等我理清了再续写此节，顺便推荐我正在看的一本《矩阵分析与应用》）。然后这里有一个此定理的证明，可以看下。

正如@Copper_PKU所说：核函数在SVM的分类效果中起了重要的作用，最后这里有个tutorial可以看看。

3.3、损失函数

在本文1.0节有这么一句话“支持向量机(SVM)是90年代中期发展起来的基于统计学习理论的一种机器学习方法，通过寻求结构化风险最小来提高学习机泛化能力，实现经验风险和置信范围的最小化，从而达到在统计样本量较少的情况下，亦能获得良好统计规律的目的。”但初次看到的读者可能并不了解什么是结构化风险，什么又是经验风险。要了解这两个所谓的“风险”，还得又从监督学习说起。

监督学习实际上就是一个经验风险或者结构风险函数的最优化问题。风险函数度量平均意义下模型预测的好坏，模型每一次预测的好坏用损失函数来度量。它从假设空间F中选择模型f作为决策函数，对于给定的输入X，由f(X)给出相应的输出Y，这个输出的预测值f(X)与真实值Y可能一致也可能不一致，用一个损失函数来度量预测错误的程度。损失函数记为L(Y, f(X))。

常用的损失函数有以下几种（基本引用自《统计学习方法》）：

如此，SVM有第二种理解，即最优化+损失最小，或如@夏粉_百度所说“可从损失函数和优化算法角度看SVM，boosting，LR等算法，可能会有不同收获”。

OK，关于更多统计学习方法的问题，请参看此文。

关于损失函数，如下文读者评论中所述：可以看看张潼的这篇《Statistical behavior and consistency of classification methods based on convex risk minimization》。各种算法中常用的损失函数基本都具有fisher一致性，优化这些损失函数得到的分类器可以看作是后验概率的“代理”。此外，张潼还有另外一篇论文《Statistical analysis of some multi-category large margin classification methods》，在多分类情况下margin loss的分析，这两篇对Boosting和SVM使用的损失函数分析的很透彻。

3.4、最小二乘法

3.4.1、什么是最小二乘法？

既然本节开始之前提到了最小二乘法，那么下面引用《正态分布的前世今生》里的内容稍微简单阐述下。

我们口头中经常说：一般来说，平均来说。如平均来说，不吸烟的健康优于吸烟者，之所以要加“平均”二字，是因为凡事皆有例外，总存在某个特别的人他吸烟但由于经常锻炼所以他的健康状况可能会优于他身边不吸烟的朋友。而最小二乘法的一个最简单的例子便是算术平均。

最小二乘法（又称最小平方法）是一种数学优化技术。它通过最小化误差的平方和寻找数据的最佳函数匹配。利用最小二乘法可以简便地求得未知的数据，并使得这些求得的数据与实际数据之间误差的平方和为最小。用函数表示为：

使误差「所谓误差，当然是观察值与实际真实值的差量」平方和达到最小以寻求估计值的方法，就叫做最小二乘法，用最小二乘法得到的估计，叫做最小二乘估计。当然，取平方和作为目标函数只是众多可取的方法之一。

最小二乘法的一般形式可表示为：

有效的最小二乘法是勒让德在 1805 年发表的，基本思想就是认为测量中有误差，所以所有方程的累积误差为

我们求解出导致累积误差最小的参数即可：

勒让德在论文中对最小二乘法的优良性做了几点说明：

最小二乘使得误差平方和最小，并在各个方程的误差之间建立了一种平衡，从而防止某一个极端误差取得支配地位
计算中只要求偏导后求解线性方程组，计算过程明确便捷
最小二乘可以导出算术平均值作为估计值

对于最后一点，从统计学的角度来看是很重要的一个性质。推理如下：假设真值为 θ , x1,⋯,xn 为n次测量值, 每次测量的误差为 ei=xi−θ ，按最小二乘法，误差累积为

求解使达到最小，正好是算术平均。

由于算术平均是一个历经考验的方法，而以上的推理说明，算术平均是最小二乘的一个特例，所以从另一个角度说明了最小二乘方法的优良性，使我们对最小二乘法更加有信心。

最小二乘法发表之后很快得到了大家的认可接受，并迅速的在数据分析实践中被广泛使用。不过历史上又有人把最小二乘法的发明归功于高斯，这又是怎么一回事呢。高斯在1809年也发表了最小二乘法，并且声称自己已经使用这个方法多年。高斯发明了小行星定位的数学方法，并在数据分析中使用最小二乘方法进行计算，准确的预测了谷神星的位置。

说了这么多，貌似跟本文的主题SVM没啥关系呀，别急，请让我继续阐述。本质上说，最小二乘法即是一种参数估计方法，说到参数估计，咱们得从一元线性模型说起。

3.4.2、最小二乘法的解法

什么是一元线性模型呢？请允许我引用这里的内容，先来梳理下几个基本概念：

监督学习中，如果预测的变量是离散的，我们称其为分类（如决策树，支持向量机等），如果预测的变量是连续的，我们称其为回归。
回归分析中，如果只包括一个自变量和一个因变量，且二者的关系可用一条直线近似表示，这种回归分析称为一元线性回归分析。
如果回归分析中包括两个或两个以上的自变量，且因变量和自变量之间是线性关系，则称为多元线性回归分析。
对于二维空间线性是一条直线；对于三维空间线性是一个平面，对于多维空间线性是一个超平面...

对于一元线性回归模型, 假设从总体中获取了n组观察值（X1，Y1），（X2，Y2）， …，（Xn，Yn）。对于平面中的这n个点，可以使用无数条曲线来拟合。要求样本回归函数尽可能好地拟合这组值。综合起来看，这条直线处于样本数据的中心位置最合理。

选择最佳拟合曲线的标准可以确定为：使总的拟合误差（即总残差）达到最小。有以下三个标准可以选择：

用“残差和最小”确定直线位置是一个途径。但很快发现计算“残差和”存在相互抵消的问题。
用“残差绝对值和最小”确定直线位置也是一个途径。但绝对值的计算比较麻烦。
最小二乘法的原则是以“残差平方和最小”确定直线位置。用最小二乘法除了计算比较方便外，得到的估计量还具有优良特性。这种方法对异常值非常敏感。

最常用的是普通最小二乘法（ Ordinary Least Square，OLS）：所选择的回归模型应该使所有观察值的残差平方和达到最小，即采用平方损失函数。　

我们定义样本回归模型为：

其中ei为样本（Xi, Yi）的误差。

接着，定义平方损失函数Q：

则通过Q最小确定这条直线，即确定

，以

为变量，把它们看作是Q的函数，就变成了一个求极值的问题，可以通过求导数得到。

求Q对两个待估参数的偏导数：

根据数学知识我们知道，函数的极值点为偏导为0的点。

解得：

这就是最小二乘法的解法，就是求得平方损失函数的极值点。自此，你看到求解最小二乘法与求解SVM问题何等相似，尤其是定义损失函数，而后通过偏导求得极值。

OK，更多请参看陈希孺院士的《数理统计学简史》的第4章、最小二乘法。

3.5、SMO算法

在上文中，我们提到了求解对偶问题的序列最小最优化SMO算法，但并未提到其具体解法。首先看下最后悬而未决的问题：

等价于求解：

1998年，Microsoft Research的John C. Platt在论文《Sequential Minimal Optimization：A Fast Algorithm for Training Support Vector Machines》中提出针对上述问题的解法：SMO算法，它很快便成为最快的二次规划优化算法，特别是在针对线性SVM和数据稀疏时性能更优。

接下来，咱们便参考John C. Platt的这篇文章来看看SMO的解法是怎样的。

3.5.1、SMO算法的推导

咱们首先来定义特征到结果的输出函数：

注：这个u与我们之前定义的实质是一样的。

接着，重新定义下咱们原始的优化问题，权当重新回顾，如下：

求导得到：

代入中，可得。

通过引入拉格朗日乘子转换为对偶问题后，得：

s.t：

且

注：这里得到的min函数与我们之前的max函数实质也是一样，因为把符号变下，即由min转化为max的问题，且yi也与之前的等价，yj亦如此。

经过加入松弛变量后，模型修改为：

从而最终我们的问题变为：

下面要解决的问题是：在上求上述目标函数的最小值。为了求解这些乘子，每次从中任意抽取两个乘子和，然后固定和以外的其它乘子，使得目标函数只是关于和的函数。这样，不断的从一堆乘子中任意抽取两个求解，不断的迭代求解子问题，最终达到求解原问题的目的。

而原对偶问题的子问题的目标函数可以表达为：

其中

为了解决这个子问题，首要问题便是每次如何选取和。实际上，其中一个乘子是违法KKT条件最严重的，另外一个乘子则由另一个约束条件选取。

根据KKT条件可以得出目标函数中取值的意义：

这里的

还是拉格朗日乘子：

对于第1种情况，表明是正常分类，在边界内部（我们知道正确分类的点）；
对于第2种情况，表明了是支持向量，在边界上；
对于第3种情况，表明了是在两条边界之间；

而最优解需要满足KKT条件，即上述3个条件都得满足，以下几种情况出现将会出现不满足：

<=1但是<C则是不满足的，而原本=C
>=1但是>0则是不满足的，而原本=0
=1但是=0或者=C则表明不满足的，而原本应该是0<<C

也就是说，如果存在不满足KKT条件的

，那么需要更新这些

，这是第一个约束条件。此外，更新的同时还要受到第二个约束条件的限制，即。

因此，如果假设选择的两个乘子

和

，它们在更新之前分别是

、

，更新之后分别是

、

，那么更新前后的值需要满足以下等式才能保证和为0的约束：

其中，

是常数。

两个因子不好同时求解，所以可先求第二个乘子

的解（

），得到

的解（

）之后，再用

的解（

）表示

的解（

）。

为了求解，得先确定的取值范围。假设它的上下边界分别为H和L，那么有：

接下来，综合

和

这两个约束条件，求取

的取值范围。

当y1 != y2时，根据可得，所以有，，如下图所示：

当y1 = y2时，同样根据可得：，所以有，，如下图所示：

如此，根据y1和y2异号或同号，可得出

的上下界分别为：

回顾下第二个约束条件

，令上式两边乘以y1，可得

其中，

。

因此

可以用

表示，

，从而把子问题的目标函数转换为只含

的问题：

对

求导，可得

化简下：

然后将

、

、和

代入上式可得：

令

（表示预测值与真实值之差），

，然后上式两边同时除以

，得到一个关于单变量

的解：

这个解没有考虑其约束条件

，即是未经剪辑时的解。

然后考虑约束

可得到经过剪辑后的

的解析解为：

求出了后

，便可以求出

，得

。

那么如何选择乘子

和

呢？

对于，即第一个乘子，可以通过刚刚说的那3种不满足KKT的条件来找；
而对于第二个乘子可以寻找满足条件：的乘子。

而b在满足下述条件：

下更新b：

且每次更新完两个乘子的优化后，都需要再重新计算b，及对应的Ei值。

最后更新所有

，y和b，这样模型就出来了，从而即可求出咱们开头提出的分类函数：

此外，这里也有一篇类似的文章，大家可以参考下。

3.5.2、SMO算法的步骤

综上，总结下SMO的主要步骤，如下：

意思是，

第一步选取一对和，选取方法使用启发式方法；
第二步，固定除和之外的其他参数，确定W极值条件下的，由表示。

假定在某一次迭代中，需要更新

，

对应的拉格朗日乘子

，

，那么这个小规模的二次规划问题写为：

那么在每次迭代中，如何更新乘子呢？引用这里的两张PPT说明下：

知道了如何更新乘子，那么选取哪些乘子进行更新呢？具体选择方法有以下两个步骤：

步骤1：先“扫描”所有乘子，把第一个违反KKT条件的作为更新对象，令为a2；
步骤2：在所有不违反KKT条件的乘子中，选择使|E1 −E2|最大的a1进行更新，使得能最大限度增大目标函数的值（类似于梯度下降。此外，而，求出来的E代表函数ui对输入xi的预测值与真实输出类标记yi之差）。

最后，每次更新完两个乘子的优化后，都需要再重新计算b，及对应的Ei值。

综上，SMO算法的基本思想是将Vapnik在1982年提出的Chunking方法推到极致，SMO算法每次迭代只选出两个分量ai和aj进行调整，其它分量则保持固定不变，在得到解ai和aj之后，再用ai和aj改进其它分量。与通常的分解算法比较，尽管它可能需要更多的迭代次数，但每次迭代的计算量比较小，所以该算法表现出整理的快速收敛性，且不需要存储核矩阵，也没有矩阵运算。

3.5.3、SMO算法的实现

行文至此，我相信，SVM理解到了一定程度后，是的确能在脑海里从头至尾推导出相关公式的，最初分类函数，最大化分类间隔，max1/||w||，min1/2||w||^2，凸二次规划，拉格朗日函数，转化为对偶问题，SMO算法，都为寻找一个最优解，一个最优分类平面。一步步梳理下来，为什么这样那样，太多东西可以追究，最后实现。如下图所示：

至于下文中将阐述的核函数则为是为了更好的处理非线性可分的情况，而松弛变量则是为了纠正或约束少量“不安分”或脱离集体不好归类的因子。

台湾的林智仁教授写了一个封装SVM算法的libsvm库，大家可以看看，此外这里还有一份libsvm的注释文档。

除了在这篇论文《fast training of support vector machines using sequential minimal optimization》中platt给出了SMO算法的逻辑代码之外，这里也有一份SMO的实现代码，大家可以看下。

3.6、SVM的应用

或许我们已经听到过，SVM在很多诸如文本分类，图像分类，生物序列分析和生物数据挖掘，手写字符识别等领域有很多的应用，但或许你并没强烈的意识到，SVM可以成功应用的领域远远超出现在已经在开发应用了的领域。

3.6.1、文本分类

一个文本分类系统不仅是一个自然语言处理系统，也是一个典型的模式识别系统，系统的输入是需要进行分类处理的文本，系统的输出则是与文本关联的类别。由于篇幅所限，其它更具体内容本文将不再详述。

OK，本节虽取标题为证明SVM，但聪明的读者们想必早已看出，其实本部分并无多少证明部分（特此致歉），怎么办呢？可以参阅《支持向量机导论》一书，此书精简而有趣。本节完。

读者评论

本文发表后，微博上的很多朋友给了不少意见，以下是节选的一些精彩评论：

“压力”陡增的评论→//@藏了个锋：我是看着July大神的博文长大的啊//@zlkysl：就是看了最后那一篇才决定自己的研究方向为SVM的。--http://weibo.com/1580904460/zraWk0u6u?mod=weibotime。
@张金辉：“SVM的三重境界，不得不转的一篇。其实Coursera的课堂上Andrew Ng讲过支持向量机，但显然他没有把这作为重点，加上Ng讲支持向量机的方法我一时半会难以完全消化，所以听的也是一知半解。真正开始了解支持向量机就是看的这篇“三重境界”，之后才对这个算法有了大概的概念，以至如何去使用，再到其中的原理为何，再到支持向量机的证明等。总之，这篇文章开启了我长达数月的研究支持向量机阶段，直到今日。”--http://zhan.renren.com/profile/249335584?from=template#!//tag/三重境界。
@孤独之守望者："最后，推出svm的cost function 是hinge loss，然后对比其他的方法的cost function，说明其实他们的目标函数很像，那么问题是svm为什么这么popular呢？您可以再加些VC dimension跟一些error bound的数学，点一下，提供一个思路和方向"。--http://weibo.com/1580904460/AiohoyDwq?mod=weibotime。
@夏粉_百度：“在面试时，考察SVM可考察机器学习各方面能力：目标函数,优化过程,并行方法，算法收敛性,样本复杂度，适用场景,调参经验，不过个人认为考察boosting和LR也还不错啊。此外，随着统计机器学习不断进步，SVM只被当成使用了一个替代01损失hinge研究，更通用的方法被提出，损失函数研究替代损失与贝叶斯损失关系，算法稳定性研究替代损失与推广性能关系,凸优化研究如何求解凸目标函数，SVM,boosting等算法只是这些通用方法的一个具体组建而已。”
@居里猴姐：关于SVM损失函数的问题，可以看看张潼老师的这篇《Statistical behavior and consistency of classification methods based on convex risk minimization》。各种算法中常用的损失函数基本都具有fisher一致性，优化这些损失函数得到的分类器可以看作是后验概率的“代理”。此外，张潼老师还有另外一篇论文《Statistical analysis of some multi-category large margin classification methods》，在多分类情况下margin loss的分析，这两篇对Boosting和SVM使用的损失函数分析的很透彻。
@夏粉_百度：SVM用了hinge损失，hinge损失不可导，不如其它替代损失方便优化并且转换概率麻烦。核函数也不太用，现在是大数据时代，样本非常大，无法想象一个n^2的核矩阵如何存储和计算。而且，现在现在非线性一般靠深度学习了。//@Copper_PKU:请教svm在工业界的应用典型的有哪些？工业界如何选取核函数，经验的方法？svm的训练过程如何优化？
@Copper_PKU：July的svm tutorial 我个人觉得还可以加入和修改如下部分：(1) 对于支持向量解释，可以结合图和拉格朗日参数来表达，松弛中sv没有写出来. (2) SMO算法部分，加入Joachims论文中提到的算法，以及SMO算法选取workset的方法，包括SMO算法的收敛判断，还有之前共轭梯度求解方法，虽然是较早的算法，但是对于理解SMO算法有很好的效果。模型的优化和求解都是迭代的过程，加入历史算法增强立体感。-- http://weibo.com/1580904460/Akw6dl3Yk#_rnd1385474436177。
//@廖临川: 之所以sgd对大训练集的效果更好，1.因为SGD优化每次迭代使用样本子集，比使用训练全集（尤其是百万数量级）要快得多；2.如果目标函数是凸的或者伪凸的，SGD几乎必然可以收敛到全局最优；否则，则收敛到局部最优；3.SGD一般不需要收敛到全局最优，只要得到足够好的解，就可以立即停止。//@Copper_PKU：sgd的核心思想：是迭代训练，每拿到一个样本就算出基于当前w(t) 的loss function，t代表训练第t次，然后进行下一w（t+1）的更新，w(t+1)=w(t)-(learning rate) * loss function的梯度，这个类比神经网络中bp中的参数训练方法。 sample by sample就是每次仅处理一个样本而不是一个batch。
//@Copper_PKU：从损失函数角度说：primal问题可以理解为正则化项+lossfunction，求解目标是在两个中间取平衡如果强调loss function最小则会overfitting，所以有C参数。 //@研究者July：SVM还真就是在一定限定条件下，即约束条件下求目标函数的最优值问题，同时，为减少误判率，尽量让损失最小。
...

非常享受这种全民大讨论的年代，没有谁一定就对或一定就错，而是各自发表各自的理解见解，真棒！

参考文献及推荐阅读

《支持向量机导论》，[美] Nello Cristianini / John Shawe-Taylor 著；
支持向量机导论一书的支持网站：http://www.support-vector.net/；
《数据挖掘导论》，[美] Pang-Ning Tan / Michael Steinbach / Vipin Kumar 著；
《数据挖掘：概念与技术》，(加)Jiawei Han;Micheline Kamber 著；
《数据挖掘中的新方法：支持向量机》，邓乃扬田英杰著；
《支持向量机--理论、算法和扩展》，邓乃扬田英杰著；
支持向量机系列，pluskid：http://blog.pluskid.org/?page_id=683；
http://www.360doc.com/content/07/0716/23/11966_615252.shtml；
数据挖掘十大经典算法初探；
《模式识别支持向量机指南》，C.J.C Burges 著；
《统计学习方法》，李航著；
《统计自然语言处理》，宗成庆编著，第十二章、文本分类；
SVM入门系列，Jasper：http://www.blogjava.net/zhenandaci/category/31868.html；
最近邻决策和SVM数字识别的实现和比较，作者不详；
斯坦福大学机器学习课程原始讲义：http://www.cnblogs.com/jerrylead/archive/2012/05/08/2489725.html；
斯坦福机器学习课程笔记：http://www.cnblogs.com/jerrylead/tag/Machine%20Learning/；
http://www.cnblogs.com/jerrylead/archive/2011/03/13/1982639.html；
SMO算法的数学推导：http://www.cnblogs.com/jerrylead/archive/2011/03/18/1988419.html；
数据挖掘掘中所需的概率论与数理统计知识、上；
关于机器学习方面的文章，可以读读：http://www.cnblogs.com/vivounicorn/category/289453.html；
数学系教材推荐：http://blog.sina.com.cn/s/blog_5e638d950100dswh.html；
《神经网络与机器学习(原书第三版)》，[加] Simon Haykin 著；
正态分布的前世今生：http://t.cn/zlH3Ygc；
《数理统计学简史》，陈希孺院士著；
《最优化理论与算法(第2版)》，陈宝林编著；
A Gentle Introduction to Support Vector Machines in Biomedicine：http://www.nyuinformatics.org/downloads/supplements/SVM_Tutorial_2010/Final_WB.pdf，此PPT很赞，除了对引入拉格朗日对偶变量后的凸二次规划问题的深入度不够之外，其它都挺好，配图很精彩，本文有几张图便引自此PPT中；
来自卡内基梅隆大学carnegie mellon university(CMU)的讲解SVM的PPT：http://www.autonlab.org/tutorials/svm15.pdf；
发明libsvm的台湾林智仁教授06年的机器学习讲义SVM：http://wenku.baidu.com/link?url=PWTGMYNb4HGUrUQUZwTH2B4r8pIMgLMiWIK1ymVORrds_11VOkHwp-JWab7IALDiors64JW_6mD93dtuWHwFWxsAk6p0rzchR8Qh5_4jWHC；
http://staff.ustc.edu.cn/~ketang/PPT/PRLec5.pdf；
Introduction to Support Vector Machines (SVM)，By Debprakash Patnai M.E (SSA)，https://www.google.com.hk/url?sa=t&rct=j&q=&esrc=s&source=web&cd=1&ved=0CCwQFjAA&url=http%3a%2f%2fwww%2epws%2estu%2eedu%2etw%2fccfang%2findex%2efiles%2fAI%2fAI%26ML-Support%2520Vector%2520Machine-1%2eppt&ei=JRR6UqT5C-iyiQfWyIDgCg&usg=AFQjCNGw1fTbpH4ltQjjmx1d25ZqbCN9nA；
多人推荐过的libsvm：http://www.csie.ntu.edu.tw/~cjlin/libsvm/；
《machine learning in action》，中文版为《机器学习实战》；
SMO算法的提出：Sequential Minimal Optimization A Fast Algorithm for Training Support Vector Machines：http://research.microsoft.com/en-us/um/people/jplatt/smoTR.pdf；
《统计学习理论的本质》，[美] Vladimir N. Vapnik著，非常晦涩，不做过多推荐；
张兆翔，机器学习第五讲之支持向量机http://irip.buaa.edu.cn/~zxzhang/courses/MachineLearning/5.pdf；
VC维的理论解释：http://www.svms.org/vc-dimension/，中文VC维解释http://xiaoxia001.iteye.com/blog/1163338；
来自NEC Labs America的Jason Weston关于SVM的讲义http://www.cs.columbia.edu/~kathy/cs4701/documents/jason_svm_tutorial.pdf；
来自MIT的SVM讲义：http://www.mit.edu/~9.520/spring11/slides/class06-svm.pdf；
PAC问题：http://www.cs.huji.ac.il/~shashua/papers/class11-PAC2.pdf；
百度张潼老师的两篇论文：《Statistical behavior and consistency of classification methods based on convex risk minimization》http://home.olemiss.edu/~xdang/676/Consistency_of_Classification_Convex_Risk_Minimization.pdf，《Statistical analysis of some multi-category large margin classification methods》；
http://jacoxu.com/?p=39；
《矩阵分析与应用》，清华张贤达著；
SMO算法的实现：http://blog.csdn.net/techq/article/details/6171688；
常见面试之机器学习算法思想简单梳理：http://www.cnblogs.com/tornadomeet/p/3395593.html；
矩阵的wikipedia页面：http://zh.wikipedia.org/wiki/%E7%9F%A9%E9%98%B5；
最小二乘法及其实现：http://blog.csdn.net/qll125596718/article/details/8248249；
统计学习方法概论：http://blog.csdn.net/qll125596718/article/details/8351337；
http://www.csdn.net/article/2012-12-28/2813275-Support-Vector-Machine；
A Tutorial on Support Vector Regression：http://alex.smola.org/papers/2003/SmoSch03b.pdf；SVR简明版：http://www.cmlab.csie.ntu.edu.tw/~cyy/learning/tutorials/SVR.pdf。
SVM Org：http://www.support-vector-machines.org/；
R. Collobert. Large Scale Machine Learning. Université Paris VI phd thesis. 2004：http://ronan.collobert.com/pub/matos/2004_phdthesis_lip6.pdf；
Making Large-Scale SVM Learning Practical：http://www.cs.cornell.edu/people/tj/publications/joachims_99a.pdf；
文本分类与SVM：http://blog.csdn.net/zhzhl202/article/details/8197109；
Working Set Selection Using Second Order Information
for Training Support Vector Machines：http://www.csie.ntu.edu.tw/~cjlin/papers/quadworkset.pdf；
SVM Optimization: Inverse Dependence on Training Set Size：http://icml2008.cs.helsinki.fi/papers/266.pdf；
Large-Scale Support Vector Machines: Algorithms and Theory：http://cseweb.ucsd.edu/~akmenon/ResearchExam.pdf；
凸优化的概念：http://cs229.stanford.edu/section/cs229-cvxopt.pdf；
《凸优化》，作者: Stephen Boyd / Lieven Vandenberghe，原作名: Convex Optimization；
Large-scale Non-linear Classification: Algorithms and Evaluations，Zhuang Wang，讲了很多SVM算法的新进展：http://ijcai13.org/files/tutorial_slides/te2.pdf；
基于SMO算法实现SVM：http://www.cs.iastate.edu/~honavar/smo-svm.pdf；
copper推荐的一些SVM相关的论文（当然，其中不少论文在上面的条目中都已经提到）：http://c.blog.sina.com.cn/profile.php?blogid=68d0b92d89000h35。

后记

OK，此文从最初2012年5月开始动笔，到后续不断的修改，创造了三个之最，即所写时间最长，所花心血最大，所改次数最多，因为我的目标是让没有任何机器学习基础的都能看懂此文，所以总是不停的改，不停的改，不想放过任何一个小的细节。再者，引用侯捷的一句话是：天下大作，必作于细。

最后，非常感谢pluskid及诸多朋友们的文章及著作，让我有机会在其基础上总结、深入。有任何问题，敬请广大读者随时不吝批评指正，感谢。

updated、本文PDF版

13年11月25日，用chrome浏览器打开文章，右键打印，弹出打印框，把左上角的目标更改为“另存为PDF”，成第一个PDF：http://vdisk.weibo.com/s/zrFL6OXKghu5V。
13年12月7日，朋友吴新隆用“印象笔记”提取出博客正文，放到office内编辑成此PDF：http://vdisk.weibo.com/s/zrFL6OXKgQHm8，较上一版本添加了完整的书签。
14年 2月18日，朋友邬书哲用Latex全部重排了本文所有公式，而且给所有公式和图片全部做了标记，Latex版PDF下载地址为：http://vdisk.weibo.com/s/zrFL6OXKgnlcp。
15年1月8日，朋友陈笙再为本SVM一文弄了最新的第二个LaTeX版本，下载地址为：http://pan.baidu.com/s/1eQrgiOU。

本文会一直不断翻新，再者，上述 4 个PDF的阅读体验也还不是最好的，如果有朋友制作了更好的PDF，欢迎分享给我：http://weibo.com/julyweibo，谢谢。

你可能感兴趣的:(July大神---SVM讲解)

用Python下载指定URL的图片并保存到本地清水白石008 Python题库 python python 开发语言
用Python下载指定URL的图片并保存到本地在今天的互联网时代，图像和多媒体内容的使用日益普遍。Python作为一种高效的编程语言，提供了强大的库来处理网络请求和文件操作。本文将详细讲解如何编写一个程序，通过指定的URL下载图片并将其保存到本地。一、环境准备1.1安装Python确保你的计算机上已经安装了Python。你可以在Python官方网站下载并安装最新版本。1.2安装所需库为了进行网络请
小白编程教程，编程设计中的三大程序控制结构，扣子平台的循环节点如何使用？扣子免费系列教程（26）涛涛讲AI 扣子AI应用免费教程数据库前端机器学习
大家好，我是涛涛。今天这一节课，我将为大家讲解编程语言中的程序控制结构。在计算机编程语言中，有三大程序控制结构：顺序、分支和循环。毫不夸张地说，只要你掌握了这三种程序控制结构，你基本就掌握了计算机编程语言的一半能力，可见其重要性。在本节课中，你不仅可以学习到循环结构的使用，还能够掌握在Coze平台上如何添加循环插件、设定循环变量、配置循环条件，最终完成文案的批量改写，实现高效的数据处理任务执行。1
加油站会员管理小程序实战开发教程11 低代码布道师加油站会员管理小程序实战教程小程序微信小程序微信低代码微搭
我们已经用了10篇的篇幅讲解了首页的功能，首页主要是用来展示信息的。那么接下来就要进入我们的功能页面了，会员管理一个比较重要的功能是充值的功能。要想实现充值功能，首先需要办一张会员卡，那什么时候办理会员卡呢？需要先注册成为会员，然后进行开卡的动作。这里要注意，会员的信息是唯一的，但是卡呢一个会员可能有多张，因为一个加油站不仅加汽油、也可能加柴油，有的可能还可以加天然气。根据业务的不同可以办理不同的
<鸿蒙生态学堂线上培训第14期>体验打磨：应用横竖屏无缝切换 harmonyos
课程简介本课程是【HarmonyOS生态学堂线上培训】的第14期。应用存在竖屏和横屏两种操作体验:竖屏便于单手操作，适合日常使用场景；横屏拥有宽阔视野，利于视频播放、文档处理等场景。若横竖屏切换体验设计不完善，就可能出现画面变形、内容显示不全、布局错乱等问题，影响用户体验。本课程聚焦应用横竖屏切换，通过横竖屏功能讲解，提供不同终端的优化建议，并结合典型案例与常见问题，给予更加顺滑、稳定的横竖屏切换
Python爬虫入门实例：Python7个爬虫小案例（附源码） m0_74823683 面试学习路线阿里巴巴 python 爬虫开发语言
引言随着互联网的快速发展，数据成为了新时代的石油。Python作为一种高效、易学的编程语言，在数据采集领域有着广泛的应用。本文将详细讲解Python爬虫的原理、常用库以及实战案例，帮助读者掌握爬虫技能。一、爬虫原理爬虫，又称网络爬虫，是一种自动获取网页内容的程序。它模拟人类浏览网页的行为，发送HTTP请求，获取网页源代码，再通过解析、提取等技术手段，获取所需数据。1.HTTP请求与响应过程爬虫首先
RapidJSON 处理 JSON（高性能 C++ 库）（四）风一流世 C/C++JSON json c++rapidjson
第四部分：RapidJSON处理JSON（高性能C++库）快速掌握JSON！文章+视频双管齐下如果你觉得阅读文章太慢，或者更喜欢边看边学的方式，不妨直接观看我录制的RapidJSON课程视频！视频里会用更直观的方式讲解RapidJSON的核心概念、实战技巧，并配有动手演示，让你更高效地掌握RapidJSON的处理方法！当然，如果你喜欢深度阅读，这篇文章会帮助你系统地理解RapidJSON，从基础到
数据结构C语言练习(栈) 南玖yy 数据结构 c语言算法
一、引言在LeetCode20题“有效的括号”中，我们需要判断一个只包含{}[]()的字符串是否有效。本文通过实现一个动态栈结构，详细讲解代码逻辑，帮助理解栈在括号匹配问题中的应用。二、栈结构核心函数讲解1.栈的初始化：StackInitvoidStackInit(Stack*ps){ps->_a=NULL;ps->_top=ps->_capacity=0;}作用：初始化栈的成员变量。细节：将存储
Redis详解（非关系型数据库）写代码的加鲁鲁 redis nosql 数据库 1024程序员节
博主专注于做Java程序开发相关技术分享，旨在与各路大神做技术交流，觉得不错的朋友，点个关注，有想深度交流，也可参考博主其他文章：java架构师知识技能图谱-CSDN博客前言上文介绍了关系型数据库，但是在日常开发中，业务数据除了会保存在关系型数据库中外，我们也会遇到一些数据并不适合用关系型数据保存，而更适合保存于非关系型数据库中。所以，本文主要介绍非关系型数据库的一些功能1.缓存数据库1.1作用a
java常用框架简介写代码的加鲁鲁 1024程序员节
前言博主专注于做Java程序开发相关技术分享，旨在与各路大神做技术交流，觉得不错的朋友，点个关注，有想深度交流，也可参考博主其他文章：java架构师知识技能图谱-CSDN博客1.SpringSpringboot简化了基于Spring开发的项目配置1.1常用注解1.1.1异步a.@EnableAsync开启对异步任务的支持，可以放在springboot的启动类上，也可以放在自定义线程池的配置类上，此
论 JVM 简述写代码的加鲁鲁 jvm java 开发语言 1024程序员节
博主专注于做Java程序开发相关技术分享，旨在与各路大神做技术交流，觉得不错的朋友，点个关注，有想深度交流，也可参考博主其他文章：java架构师知识技能图谱-CSDN博客前言学习一门语言，我们必须得了解这门语言是如何运行的。所以对于java来说，我们首先要了解jvm。所谓jvm，故名思义，即java虚拟机，提供了java代码执行的环境，jvm有各个版本，本质上来说，其实是一个在内存中的虚拟机，所以
Oracle数据库数据编程SQL＜4.1 事务（会面试的哦）＞ Tyler先森 Oracle 数据库 oracle sql
事务是Oracle数据库中最基本的工作单元，它代表一组必须全部成功或全部失败的SQL语句。下面我将详细讲解Oracle中的事务概念、特性、控制和管理。目录一、事务的基本概念二、事务的特性(ACID)1、原子性(Atomicity)：2、一致性(Consistency)：3、隔离性(Isolation)：4、持久性(Durability)：三、Oracle事务控制语句1.COMMIT：2.ROLLB
基于Springboot+Vue动漫推荐平台管理系统（源码+lw+讲解部署+PPT）嘤er 前端 vue.js javascript mysql spring boot java 后端
前言详细视频演示论文参考系统介绍系统概述核心功能用户角色与功能具体实现截图1.热门动漫功能2.文章专栏功能3.会员分享功能4.热门动漫管理功能（管理员端）5.动漫分类管理功能技术栈后端框架SpringBoot前端框架Vue持久层框架MyBatis-Plus其他技术组件系统实现与后端代码结构代码结构概述系统测试系统测试目的系统功能测试1.登录功能测试2.热门动漫功能测试3.文章专栏功能测试4.会员分
控制器电源方案：DC-DC与LDO怎么选？码小文嵌入式硬件硬件工程学习
目录|引言|DC-DC、LDO工作方式介绍|DC-DC、LDO的种类|DC-DC、LDO的特点|DC-DCorLDO怎么选？|DC-DC或LDO应用注意事项|结语|引言一个好的单板设计离不开一个好的电源方案；优良的电源方案可以大大降低后期EMC、EMI测试的难度；同时，也能提高产品对复杂工况的适应性。本篇小文主要讲解常用的电源：DC-DC和LDO的工作方式、特点、选型时需考虑的因素，以及应用时的注
Android应用开发gps,Android应用开发实战:GPS与加速度传感器桔了个仔 Android应用开发gps
【IT168技术文档】本文将为读者详细介绍Android中增强现实应用程序的两个关键元素：GPS与加速度传感器。在前一篇文章《编程实现谷歌Android摄像头拍照》中，我们介绍了在增强现实技术(AR)引擎中AndroidSDK的两种基本构件即摄像头的用法。在本文中，我们将继续介绍另外两种基础构件，即GPS与加速度传感器。我们首先介绍所需的工具，然后讲解如何请求位置更新，并说明加速度传感器的工作机制
Kimichat使用案例012：用Kimichat拆解雷军在小米汽车SU7发布会上的演讲技巧翰墨之道 GPT开发 GPT应用专栏汽车 Kimichat Kimi 雷军小米汽车SU7 演讲技巧
文章目录一、介绍二、输入内容三、输出内容四、继续追问五、继续回答六、讲解对比七、对比回答相似之处：不同之处：八、职场人士如何借鉴九、借鉴内容一、介绍小米SU7发布会可以说是非常成功。雷军的演讲技巧是发布会成功的重要因素之一，很值得借鉴学习。可以借助Kimichat来深度拆解雷军在小米汽车SU7发布会上的演讲技巧。二、输入内容在kimichat中输入提示词：根据文件《雷军小米SU7发布会
计算机视觉入门：从像素到理解的旅程 xcLeigh 计算机视觉CV 计算机视觉人工智能 Python opencv
计算机视觉入门：从像素到理解的旅程前言一、计算机视觉基础1.1学科核心挑战1.2技术发展里程碑二、图像数字化与预处理2.1图像读取与存储2.2几何变换实战2.2.1透视变换三、传统特征工程实践3.1SIFT特征检测3.2HOG特征计算四、机器学习分类实战4.1数据集预处理4.2SVM分类器实现五、卷积神经网络详解5.1LeNet-5模型实现六、高级视觉任务实现6.1YOLOv5目标检测6.2U-N
【轴承故障诊断】基于SE-TCN和SE-TCN-SVM西储大学轴承故障诊断研究（Matlab代码实现）梦想科研社_研学支持向量机 matlab 算法
欢迎来到本博客❤️❤️博主优势：博客内容尽量做到思维缜密，逻辑清晰，为了方便读者。⛳️座右铭：行百里者，半于九十。本文目录如下：目录⛳️赠与读者1概述一、SE-TCN模型的技术原理与改进1.TCN基础架构2.SE注意力机制的引入3.SE-TCN的改进优势二、SE-TCN-SVM模型的创新设计1.模型架构2.关键改进点三、西储大学轴承数据集构成1.数据采集参数2.故障类型与尺寸四、SE-TCN-SV
《Python机器学习基础教程》第十二章计算机视觉基础12.5 深入解析：图像分类技术及其在现代应用中的重要性精通代码大仙机器学习 python 机器学习开发语言
12.5深入解析：图像分类技术及其在现代应用中的重要性12.5深入解析：图像分类技术及其在现代应用中的重要性12.5.1图像分类的基本概念12.5.2卷积神经网络（CNN）12.5.3支持向量机（SVM）12.5.4图像分类的应用场景12.5.5实操代码示例12.5.1图像分类的基本概念12.5.2卷积神经网络（CNN）12.5.3支持向量机（SVM）12.5.4图像分类的应用场景12.5.5实操
计算机毕业设计Python知识图谱中华古诗词可视化古诗词情感分析古诗词智能问答系统 AI大模型自动写诗大数据毕业设计(源码+LW文档+PPT+讲解) B站计算机毕业设计大学大数据毕业设计人工智能课程设计知识图谱大数据毕业设计 python 数据可视化
温馨提示：文末有CSDN平台官方提供的学长联系方式的名片！温馨提示：文末有CSDN平台官方提供的学长联系方式的名片！温馨提示：文末有CSDN平台官方提供的学长联系方式的名片！作者简介：Java领域优质创作者、CSDN博客专家、CSDN内容合伙人、掘金特邀作者、阿里云博客专家、51CTO特邀作者、多年架构师设计经验、多年校企合作经验，被多个学校常年聘为校外企业导师，指导学生毕业设计并参与学生毕业答辩
【轴承故障诊断】基于SE-TCN和SE-TCN-SVM江南大学轴承诊断轴承故障诊断研究（Matlab代码实现）程序猿鑫支持向量机 matlab 机器学习
欢迎来到本博客❤️❤️博主优势：博客内容尽量做到思维缜密，逻辑清晰，为了方便读者。⛳️座右铭：行百里者，半于九十。本文目录如下：目录⛳️赠与读者1概述江南大学基于SE-TCN和SE-TCN-SVM的轴承故障诊断研究一、研究背景与团队基础二、SE-TCN和SE-TCN-SVM技术原理三、实验验证与性能对比四、应用场景与未来方向五、总结2运行结果3参考文献4Matlab代码、数据下载⛳️赠与读者‍做科
PyTorch量化进阶教程：第六章模型部署与生产化船长@Quant Python 量化基础 python pytorch TA-Lib sklearn transformer 量化交易深度学习
PyTorch量化进阶教程：第六章模型部署与生产化本教程通过深入讲解Transformer架构、自注意力机制及时间序列预测，结合Tushare数据源和TA-Lib技术指标，实现从数据处理到模型训练、回测与策略部署的完整量化交易系统。教程每个环节都通过专业示例和代码实现进行阐释，确保读者能够扎实掌握并灵活运用所学知识。文中内容仅限技术学习与代码实践参考，市场存在不确定性，技术分析需谨慎验证，不构成任
暑期学什么？——关于Python爬虫方向小叮当⇔ python 爬虫开发语言
编程小白如何成为大神？大学新生的最佳入门攻略）编程语言选择学习资源推荐在线课程：教程和书籍：编程社区：学习路线图基础阶段：进阶阶段：高级阶段：编程已成为当代大学生的必备技能，而Python爬虫工程师更是一个热门且有前景的职业选择。本文将为你提供一条清晰的学习路径，帮助你从编程小白成长为Python爬虫大神。编程语言选择对于初学者来说，Python是一个非常友好的编程语言。它语法简洁、易读易写，广泛
Python利用微软Azure免费的语音合成TTS源码分享 Softboy_TM 人工智能实用软件源码工具等分享语言合成微软语音 Azure
我敢保证，用过微软的语音合成后，你就会发现这是世界上最好的语音合成软件。99.99%接近人声自然流程。语调也非常自然，结合其独特的sml标记语言，合成过程中可控制主播声色和音调，以及停顿等各种的内容。再多的介绍，自己可以百度去了解，本文讲解如何使用免费的方法合成语言输出成MP3格式的音频文件。本文最后会贴出源代码，代码需要使用Python环境，这里会详细介绍。源码在最后，使用方法见最后。源码是Py
面试八股之消息中间件篇2.1——kafka——Kafka是如何保证消息不丢失？ Ethan Yankang 面试 #MQ #kafka 面试 rabbitmq 职场和发展
hello，你好鸭，我是Ethan，一名不断学习的码农，很高兴你能来阅读。✔️目前博客主要更新Java系列、项目案例、计算机必学四件套等。人生之义，在于追求，不在成败，勤通大道。加油呀！个人主页：EthanYankang专栏：史上最强八股文||Java项目温馨提示：划到文末发现专栏彩蛋点击这里直接传送本篇概览：详细讲解了Kafka是如何保证消息不丢失？面试官：Kafka是如何保证消息不丢失候选人：
kafka 如何保证消息不丢失，详细讲解 18你磊哥 java进阶消息中间件 kafka 分布式
学海无涯，志当存远。燃心砺志，奋进不辍。愿诸君得此鸡汤，如沐春风，事业有成。若觉此言甚善，烦请赐赞一枚，共励学途，同铸辉煌！实际应用中遇到了消息丢失的问题，或者正在设计一个高可靠性的系统，需要深入理解Kafka的机制。用户可能是开发人员或者系统架构师，负责维护消息系统的稳定性。首先，明确每个配置背后的原理，以及实际操作中的注意事项。比如，生产者端的acks配置，不仅要讲设置成all，还要解释ISR
Poetry教程前言 qq_16484153 Poetry安装和使用 python pip conda
目录新手小白适合学习Poetry吗？Poetry和其他工具的区别有哪些？Poetry的命令，在Windows、Mac和Linux里，是通用的吗？本套教程，都会讲解关于Poetry的哪些方面？新手小白适合学习Poetry吗？不适合。这里所讲的新手小白，是指对于Python环境变量、pip命令、conda命令、Python虚拟环境等不熟悉者，也包括对于命令行终端不熟悉者，因为大部分的操作，还是以命令行
servlet 如何处理多请求访问以及线程讲解 weixin_30914981 java web.xml
一、Servlet如何处理多个请求访问？Servlet容器默认是采用单实例多线程的方式处理多个请求的：1.当web服务器启动的时候（或客户端发送请求到服务器时），Servlet就被加载并实例化(只存在一个Servlet实例)；2.容器初始化化Servlet主要就是读取配置文件（例如tomcat,可以通过servlet.xml的设置线程池中线程数目，初始化线程池通过web.xml,初始化每个参数值等
MAE原理与代码实例讲解 AI天才研究院计算 AI大模型企业级应用开发实战 DeepSeek R1 &大数据AI人工智能大模型计算科学神经计算深度学习神经网络大数据人工智能大型语言模型 AI AGI LLM Java Python 架构设计 Agent RPA
MAE原理与代码实例讲解作者：禅与计算机程序设计艺术/ZenandtheArtofComputerProgramming关键词：MAE,MeanAbsoluteError,绝对误差平均，回归分析，机器学习1.背景介绍1.1问题的由来在机器学习和数据科学中，评估模型预测的准确性是至关重要的。绝对误差（AbsoluteError）是衡量预测值与真实值之间差异的一种简单方法。然而，当存在大量异常值时，绝
新建按钮_PLC编程基础，西门子S7-200 SMART PLC程序的新建、编辑、包林纯新建按钮
本文主要给大伙讲解的是关于西门S7-200SMART软件如何去进行编程，其中分别详细介绍了程序编辑如何更为直观易懂，便捷快速的掌握下载和调试程序等。希望对于入门PLC的用户有所帮助，提高软件的掌握程度。第一步：新建项目双击桌面上的STEP7-Micro/WINSMART软件的快捷方式打开编程软件后，一个命名为“项目1”的空项目会自动创建。第二步：硬件组态双击项目树上方的CPUST40选项，打开“系
说一些python的技术干货，不能再干了 Helena__a python 开发语言
今天我们主要来详细讲解一下Pyhon从基础语法到高级的应用，例如如何利用Python进行数据分析、搭建Web应用，示例代码丰富且讲解清晰，对于这些想学习Python的新手小白有着很高的吸引力哦！一、Python基础语法精要（一）变量与数据类型Python无需提前声明变量类型，赋值即定义。例如：pythonname="John"#字符串类型age=25#整数类型height=1.75#浮点数类型is
对于规范和实现，你会混淆吗？ yangshangchuan HotSpot
昨晚和朋友聊天，喝了点咖啡，由于我经常喝茶，很长时间没喝咖啡了，所以失眠了，于是起床读JVM规范，读完后在朋友圈发了一条信息： JVM Run-Time Data Areas：The Java Virtual Machine defines various run-time data areas that are used during execution of a program. So
android 网络百合不是茶网络
android的网络编程和java的一样没什么好分析的都是一些死的照着写就可以了,所以记录下来方便查找 , 服务器使用的是TomCat 服务器代码; servlet的使用需要在xml中注册 package servlet; import java.io.IOException; import java.util.Arr
[读书笔记]读法拉第传 comsci 读书笔记
1831年的时候,一年可以赚到1000英镑的人..应该很少的... 要成为一个科学家,没有足够的资金支持,很多实验都无法完成但是当钱赚够了以后....就不能够一直在商业和市场中徘徊......
随机数的产生沐刃青蛟随机数
c++中阐述随机数的方法有两种：一是产生假随机数（不管操作多少次，所产生的数都不会改变）这类随机数是使用了默认的种子值产生的，所以每次都是一样的。 //默认种子 for (int i = 0; i < 5; i++) { cout<<
PHP检测函数所在的文件名 IT独行者 PHP 函数
很简单的功能，用到PHP中的反射机制，具体使用的是ReflectionFunction类，可以获取指定函数所在PHP脚本中的具体位置。创建引用脚本。代码： [php] view plain copy // Filename: functions.php <?php&nbs
银行各系统功能简介文强chu 金融
银行各系统功能简介　业务系统核心业务系统业务功能包括：总账管理、卡系统管理、客户信息管理、额度控管、存款、贷款、资金业务、国际结算、支付结算、对外接口等清分清算系统以清算日期为准，将账务类交易、非账务类交易的手续费、代理费、网络服务费等相关费用，按费用类型计算应收、应付金额，经过清算人员确认后上送核心系统完成结算的过程国际结算系
Python学习1(pip django 安装以及第一个project) 小桔子 python django pip
最近开始学习python,要安装个pip的工具。听说这个工具很强大，安装了它，在安装第三方工具的话so easy!然后也下载了，按照别人给的教程开始安装，奶奶的怎么也安装不上！第一步：官方下载pip-1.5.6.tar.gz, https://pypi.python.org/pypi/pip easy! 第二部：解压这个压缩文件，会看到一个setup.p
php 数组 aichenglong PHP 排序数组循环多维数组
1 php中的创建数组 $product = array('tires','oil','spark');//array()实际上是语言结构而不是函数 2 如果需要创建一个升序的排列的数字保存在一个数组中，可以使用range()函数来自动创建数组 $numbers=range(1,10)//1 2 3 4 5 6 7 8 9 10 $numbers=range(1,10,
安装python2.7 AILIKES python
安装python2.7 1、下载可从 http://www.python.org/进行下载#wget https://www.python.org/ftp/python/2.7.10/Python-2.7.10.tgz 2、复制解压 #mkdir -p /opt/usr/python #cp /opt/soft/Python-2
java异常的处理探讨百合不是茶 JAVA异常
//java异常 /* 1，了解java 中的异常处理机制，有三种操作 a,声明异常 b,抛出异常 c,捕获异常 2，学会使用try-catch-finally来处理异常 3，学会如何声明异常和抛出异常 4，学会创建自己的异常 */ //2，学会使用try-catch-finally来处理异常
getElementsByName实例 bijian1013 element
实例1： <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/x
探索JUnit4扩展：Runner bijian1013 java 单元测试 JUnit
参加敏捷培训时，教练提到Junit4的Runner和Rule，于是特上网查一下，发现很多都讲的太理论，或者是举的例子实在是太牵强。多搜索了几下，搜索到两篇我觉得写的非常好的文章。文章地址：http://www.blogjava.net/jiangshachina/archive/20
[MongoDB学习笔记二]MongoDB副本集 bit1129 mongodb
1. 副本集的特性 1)一台主服务器(Primary),多台从服务器(Secondary) 2)Primary挂了之后，从服务器自动完成从它们之中选举一台服务器作为主服务器，继续工作，这就解决了单点故障，因此，在这种情况下，MongoDB集群能够继续工作 3)挂了的主服务器恢复到集群中只能以Secondary服务器的角色加入进来 2
【Spark八十一】Hive in the spark assembly bit1129 assembly
Spark SQL supports most commonly used features of HiveQL. However, different HiveQL statements are executed in different manners: 1. DDL statements (e.g. CREATE TABLE, DROP TABLE, etc.)
Nginx问题定位之监控进程异常退出 ronin47
nginx在运行过程中是否稳定，是否有异常退出过？这里总结几项平时会用到的小技巧。 1. 在error.log中查看是否有signal项，如果有，看看signal是多少。比如，这是一个异常退出的情况： $grep signal error.log 2012/12/24 16:39:56 [alert] 13661#0: worker process 13666 exited on s
No grammar constraints (DTD or XML schema).....两种解决方法 byalias xml
方法一：常用方法关闭XML验证工具栏：windows => preferences => xml => xml files => validation => Indicate when no grammar is specified:选择Ignore即可。方法二：（个人推荐）添加内容如下 <?xml version=
Netty源码学习-DefaultChannelPipeline bylijinnan netty
package com.ljn.channel; /** * ChannelPipeline采用的是Intercepting Filter 模式 * 但由于用到两个双向链表和内部类，这个模式看起来不是那么明显，需要仔细查看调用过程才发现 * * 下面对ChannelPipeline作一个模拟，只模拟关键代码： */ public class Pipeline {
MYSQL数据库常用备份及恢复语句 chicony mysql
备份MySQL数据库的命令，可以加选不同的参数选项来实现不同格式的要求。 mysqldump -h主机 -u用户名 -p密码数据库名 > 文件备份MySQL数据库为带删除表的格式，能够让该备份覆盖已有数据库而不需要手动删除原有数据库。 mysqldump -–add-drop-table -uusername -ppassword databasename > ba
小白谈谈云计算--基于Google三大论文 CrazyMizzz Google 云计算 GFS
之前在没有接触到云计算之前，只是对云计算有一点点模糊的概念，觉得这是一个很高大上的东西，似乎离我们大一的还很远。后来有机会上了一节云计算的普及课程吧，并且在之前的一周里拜读了谷歌三大论文。不敢说理解，至少囫囵吞枣啃下了一大堆看不明白的理论。现在就简单聊聊我对于云计算的了解。我先说说GFS &n
hadoop 平衡空间设置方法 daizj hadoop balancer
在hdfs-site.xml中增加设置balance的带宽，默认只有1M： <property> <name>dfs.balance.bandwidthPerSec</name> <value>10485760</value> <description&g
Eclipse程序员要掌握的常用快捷键 dcj3sjt126com 编程
判断一个人的编程水平，就看他用键盘多，还是鼠标多。用键盘一是为了输入代码（当然了，也包括注释），再有就是熟练使用快捷键。曾有人在豆瓣评《卓有成效的程序员》：“人有多大懒，才有多大闲”。之前我整理了一个程序员图书列表，目的也就是通过读书，让程序员变懒。程序员作为特殊的群体，有的人可以这么懒，懒到事情都交给机器去做，而有的人又可以那么勤奋，每天都孜孜不倦得
Android学习之路 dcj3sjt126com Android学习
转自：http://blog.csdn.net/ryantang03/article/details/6901459 以前有J2EE基础，接触JAVA也有两三年的时间了，上手Android并不困难，思维上稍微转变一下就可以很快适应。以前做的都是WEB项目，现今体验移动终端项目，让我越来越觉得移动互联网应用是未来的主宰。下面说说我学习Android的感受，我学Android首先是看MARS的视
java 遍历Map的四种方法 eksliang java HashMap java 遍历Map的四种方法
转载请出自出处： http://eksliang.iteye.com/blog/2059996 package com.ickes; import java.util.HashMap; import java.util.Iterator; import java.util.Map; import java.util.Map.Entry; /** * 遍历Map的四种方式
【精典】数据库相关相关 gengzg 数据库
package C3P0; import java.sql.Connection; import java.sql.SQLException; import java.beans.PropertyVetoException; import com.mchange.v2.c3p0.ComboPooledDataSource; public class DBPool{
自动补全 huyana_town 自动补全
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"><html xmlns="http://www.w3.org/1999/xhtml&quo
jquery在线预览PDF文件，打开PDF文件天梯梦 jquery
最主要的是使用到了一个jquery的插件jquery.media.js，使用这个插件就很容易实现了。核心代码 <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.
ViewPager刷新单个页面的方法 lovelease android viewpager tag 刷新
使用ViewPager做滑动切换图片的效果时，如果图片是从网络下载的，那么再子线程中下载完图片时我们会使用handler通知UI线程，然后UI线程就可以调用mViewPager.getAdapter().notifyDataSetChanged()进行页面的刷新，但是viewpager不同于listview，你会发现单纯的调用notifyDataSetChanged()并不能刷新页面
利用按位取反（~）从复合枚举值里清除枚举值草料场 enum
以 C# 中的 System.Drawing.FontStyle 为例。如果需要同时有多种效果，如：“粗体”和“下划线”的效果，可以用按位或（|） FontStyle style = FontStyle.Bold | FontStyle.Underline; 如果需要去除 style 里的某一种效果，
Linux系统新手学习的11点建议刘星宇编程工作 linux 脚本
　　随着Linux应用的扩展许多朋友开始接触Linux，根据学习Windwos的经验往往有一些茫然的感觉：不知从何处开始学起。这里介绍学习Linux的一些建议。　　一、从基础开始：常常有些朋友在Linux论坛问一些问题，不过，其中大多数的问题都是很基础的。例如：为什么我使用一个命令的时候，系统告诉我找不到该目录，我要如何限制使用者的权限等问题，这些问题其实都不是很难的，只要了解了 Linu
hibernate dao层应用之HibernateDaoSupport二次封装 wangzhezichuan DAO Hibernate
/** * 方法描述:sql语句查询返回List<Class> * 方法备注: Class 只能是自定义类 * @param calzz * @param sql * @return * 创建人：王川 * 创建时间：Jul