机器学习第七课--SVM(2)拉格朗日算子

这节课听得吃力,能够理清主要知识点是目标。


lagrange算子用于解决有限制条件的最优化问题,其中,有一种只带等式限制条件的优化问题的形式是:

那么使用lagrange乘数法,先构建一个lagrange算子:

其中的Bi称为lagrange乘数。进而对lagrange算子求w  与 Bi 的偏导,并令这两个偏导数的值为零,表达式为:

由此求出的就是满足问题的最优解w 与 Bi. 


当限制条件中包含有不等式条件怎么办呢?形如:

机器学习第七课--SVM(2)拉格朗日算子_第1张图片

假如需要求出它的最优解,需要满足KKT条件(比前面的只需令两个偏导数为0要更加复杂一些),此时的lagrange算子可表示为:

 

—————————————————————————————————————————————

(以下部分参考 http://www.cnblogs.com/liqizhou/archive/2012/05/11/2495689.html (该文写得很棒),红色部分为自己的思考)

如果按这个公式求解偏导数,会出现问题,因为我们求解的是最小值,而这里的clip_image014[6]已经不是0了,我们可以将clip_image010[51]调整成很大的正值,来使最后的函数结果是负无穷。因此我们需要排除这种情况,我们定义下面的函数:

     clip_image015[6]

这里的P代表primal。假设clip_image017[6]或者clip_image019[6],那么我们总是可以调整clip_image010[52]clip_image012[15]来使得clip_image021[10]有最大值为正无穷。而只有g和h满足约束时,clip_image021[11]为f(w)。这个函数的精妙之处在于clip_image023[6],而且求极大值。

因此我们可以写作

     clip_image024[6]

这样我们原来要求的min f(w)可以转换成求clip_image026[10]了。    

     clip_image027[6]

我们使用clip_image029[6]来表示clip_image026[11]。如果直接求解,首先面对的是两个参数,而clip_image010[53]也是不等式约束,然后再在w上求最小值。这个过程不容易做,那么怎么办呢?(考虑使用对偶问题来求解的原因是直接求解原始问题不容易计算得答案)

我们先考虑另外一个问题clip_image030[6]

D的意思是对偶,clip_image031[10]将问题转化为先求拉格朗日关于w的最小值,将clip_image033[6]clip_image003[16]看作是固定值。之后在clip_image031[11]求最大值的话:

clip_image034[6]

这个问题是原问题的对偶问题,相对于原问题只是更换了min和max的顺序,而一般更换顺序的结果是Max Min(X) <= MinMax(X)。然而在这里两者相等。用clip_image036[6]来表示对偶问题如下:

     clip_image037[6]

下面解释在什么条件下两者会等价。假设f和g都是凸函数,h是仿射的(affine,clip_image038[6])。并且存在w使得对于所有的i,clip_image040[10]。在这种假设下,一定存在clip_image042[14]使得clip_image044[14]是原问题的解,clip_image046[6]是对偶问题的解。还有clip_image047[6]另外,clip_image042[15]满足库恩-塔克条件(Karush-Kuhn-Tucker, KKT condition),该条件如下:

     clip_image048[6]

所以如果clip_image042[16]满足了库恩-塔克条件,那么他们就是原问题和对偶问题的解。(疑惑:假如已经求解出了对应的clip_image042[15],那么如何求关于w与Bi 的偏导呢?我一直想不通,倒是觉得应该是老师的讲义上打错了 ,因为分析(3)式可知道,clip_image044[14]是原问题的解,所以,clip_image044[14]必然是原问题(表达式为L(w,a,b),没有*)关于w的偏导数为0的解。求大神帮忙解释下

让我们再次审视公式(5),这个条件称作是KKT dual complementarity条件。这个条件隐含了如果clip_image050[6],那么clip_image052[10]。也就是说,clip_image052[11]时,w处于可行域的边界上,这时才是起作用的约束。而其他位于可行域内部(clip_image054[6]的)点都是不起作用的约束,其clip_image056[6]。这个KKT双重补足条件会用来解释支持向量和SMO的收敛测试。

最优间隔分类器(optimal margin classifier)

    重新回到SVM的优化问题:

    clip_image057[6]

    我们将约束条件改写为:

    clip_image058[6]

    从KKT条件得知只有函数间隔是1(离超平面最近的点)的线性约束式前面的系数clip_image060[14],也就是说这些约束式clip_image062[6],对于其他的不在线上的点(clip_image064[6]),极值不会在他们所在的范围内取得,因此前面的系数clip_image066[14].注意每一个约束式实际就是一个训练样本。

    看下面的图:

clip_image067[6]

    实线是最大间隔超平面,假设×号的是正例,圆圈的是负例。在虚线上的点就是函数间隔是1的点,那么他们前面的系数clip_image060[15],其他点都是clip_image066[15]。这三个点称作支持向量。

构造拉格朗日函数如下:    

    clip_image068[6]

    注意到这里只有clip_image010[54]没有clip_image012[16]是因为原问题中没有等式约束,只有不等式约束。

    下面我们按照对偶问题的求解步骤来一步步进行,(验证了分析对偶问题的必要性——求解过程更加方便)

    clip_image069[10](要改)

    首先求解clip_image070[10]的最小值,对于固定的clip_image010[55]clip_image070[11]的最小值只与w和b有关。对w和b分别求偏导数。

    clip_image071[6]

    clip_image072[6]

    并得到

    clip_image073[6]

    将上式带回到拉格朗日函数中得到,此时得到的是该函数的最小值(目标函数是凸函数)

  化简后得到

clip_image074[6]

     由于最后一项是0,因此简化为

    clip_image075[6]

    这里我们将向量内积clip_image076[6]表示为clip_image077[6]

    此时的拉格朗日函数只包含了变量clip_image010[56]。然而我们求出了clip_image010[57]才能得到w和b。

    接着是极大化的过程clip_image069[11]

clip_image078[6]

    前面提到过对偶问题和原问题满足的几个条件,首先由于目标函数和线性约束都是凸函数,而且这里不存在等式约束h。存在w使得对于所有的i,clip_image040[11]。因此,一定存在clip_image080[6]使得clip_image044[15]是原问题的解,clip_image082[10]是对偶问题的解。在这里,求clip_image010[58]就是求clip_image082[11]了。

    如果求出了clip_image010[59],根据clip_image083[6]即可求出w(也是clip_image044[16],原问题的解)。然后

    clip_image084[6]

    即可求出b。即离超平面最近的正的函数间隔要等于离超平面最近的负的函数间隔。

_____________________________________________________________________

总体感受:看这节课的视频看的很难受,时间太漫长了,需要花很多时间来消化。。。

你可能感兴趣的:(网易机器学习,svm,机器学习,拉格朗日算子)