acm_JL

斯坦福大学深度学习与自然语言处理第三讲：高级的词向量表示

以下是第三讲的相关笔记，主要参考自课程的slides，视频和其他相关资料。

回顾：简单的word2vec模型

代价函数J
其中的概率函数定义为：
我们主要从内部向量(internal vector)vwI导出梯度

计算所有的梯度

我们需要遍历每一个窗口内的中心向量(center vector)的梯度
我们同时需要每一个外部向量（external vectors)v′的梯度
通常的话在每一个窗口内我们将更新计算所有用到的参数
例如在一个窗口长度为1的句子里：I like learning
第一个窗口里计算的梯度包括:内部向量vlike, 外部向量v′I及v′learning
同理更新计算句子的下一个窗口里的参数

计算所有的向量梯度

我们经常在一个模型里把所有的参数集合都定义在一个长的向量θ里
在我们的例子里是一个d维度的向量及一个长度为V的词汇集：

梯度下降

要在整个训练集上最小化代价函数J(θ)需要计算所有窗口里的参数梯度
对于参数向量θ来说需要更新其中每一个元素:
这里α是步长
从矩阵的角度来看参数更新:

梯度下降相关代码

随机梯度下降(SGD)

对于上述梯度下降的方法，训练集语料库有可能有400亿（40B）的token和窗口
一轮迭代更新需要等待很长的时间
对于非常多的神经网络节点来说这不是一个好方法
所以这里我们使用随机梯度下降（SGD）：在每一个窗口计算完毕后更新所有的参数

词向量的随机梯度下降

但是在每一个窗口里，我们仅有2c-1个词，这样的话δθJt(θ)非常稀疏
我们也许仅仅应该只更新那些确实存在的词向量
解决方案：或者保留词向量的哈稀或者更新词嵌入矩阵L和L′的固定列
很重要的一点是如果你有上百万个词向量并且在做分布式训练的话就不需要发送大量的更新信息了

PSet1

归一化因子的计算代价很大
因此在PSet1你们将实现skip-gram模型
主要的思路：对一对实际的词对（一个中心词及一个窗口内的其他词）和一些随机的词对（一个中心词及一个随机词）训练二元逻辑回归模型

PSet1: The skip-gram model and negative sampling

来源论文：Distributed Representations of Words and Phrases and their Compositionality（Mikolov et al. 2013）
这里k是我们所使用的负例采样(negative sampling)的样本数
Sigmoid函数：
所以我们最大化第一个log处两个词的共现概率
更进一步比较清晰的公式：
最大化在中心词周边真实词对的概率；最小化中心词周边随机词对的概率
这里unigram分布U(w)被赋予了3/4幂次方，这样可以保证一些出现比较少的词可以被尽可能多的抽样

What to do with the two sets of vectors?

我们从所有的向量v和v′中得到了L和L′
这两个都获得了相似的共现信息，如何有效的利用着两个向量集？一个简单有效的方法，对它们进行加和
在GloVe中对许多超参数进行了探究: Global Vectors for Word Representation (Pennington et al. (2014))

如何评测词向量

和一般的NLP评测任务相似：内部 vs 外部(Intrinsic vs extrinsic)
内部评测：
- 在一个特定的子任务中进行评测
- 计算迅速
- 有助于理解相关的系统
- 不太清楚是否有助于真实任务除非和实际的NLP任务的相关性已经建立起来
外部评测：
- 在一个真实任务中进行评测
- 需要花很长的实际来计算精度
- 不太清楚是否是这个子系统或者其他子系统引起的问题
- 如果用这个子系统替换原有的系统后获得精度提升–>有效(Winning!)

词向量的内部评测：

词向量类比:语法和语义
通过评测模型在一些语义或语法类比问题上的余弦相似度距离的表现来评测词向量
去除一些来自于搜索的输入词
问题：如果信息符合但不是线性的怎么办?

词向量的内部评测例一

词向量类比：以下语法和语义例子来源于：https://code.google.com/p/word2vec/source/browse/trunk/questions-words.txt
存在的问题：不同的城市可能存在相同的名字

词向量的内部评测例二

词向量类比：以下语法和语义例子来源于：https://code.google.com/p/word2vec/source/browse/trunk/questions-words.txt

词向量的内部评测例三

词向量类比：以下语法和语义例子来源于：https://code.google.com/p/word2vec/source/browse/trunk/questions-words.txt

词向量的内部评测例四

词向量类比：以下语法和语义例子来源于：https://code.google.com/p/word2vec/source/browse/trunk/questions-words.txt

类比评测和超参数

目前为止最细致的评测: GloVe 词向量
非对称上下文（仅有左侧的单词）并不是很好
最佳的向量维度：300左右，之后变化比较轻微
但是对于不同的“下游”任务来说最佳的维度也会不同
对于GloVe向量来说最佳的窗口长度是8
训练的时间约长是否有帮助：对于GloVe来说确实有助于
更多的数据是否有帮助？维基百科的数据比新闻数据更相关

词向量的内部评价

评测任务：词向量距离以及和人工评价的相关性
评测集：WordSim353(http://www.cs.technion.ac.il/~gabr/resources/data/wordsim353/)
相关性评测结果：

如何应对歧义问题（But what about ambiguity?）

也许你寄希望于一个词向量能捕获所有的语义信息（例如run即是动车也是名词），但是这样的话词向量会被辣向两个方向
这篇论文对此有相应的描述：Improving Word Representations Via Global Context And Multiple Word Prototypes(Huang et al. 2012)
解决思路：对词窗口进行聚类，并对每个单词词保留聚类标签，例如bank1, bank2等

词向量的外部评价

一个例子NER(named entity recognition)：好的词向量会对实际任务有直接的帮助
- 命名实体识别(NER)：找到人名，地名和机构名
下一步：如何在神经网络模型中使用词向量

简单的单个词的分类问题

从深度学习的词向量中最大的获益是什么？
- 有能力对单词进行精确的分类
  - 国家类的单词可以聚和到一起–>因此可以通过词向量将地名类的单词区分出来
- 可以在其他的任务中将单词的任意信息融合进来
  - 可以将情感分析（Sentiment)问题映射到单词分类中：在语料库中寻找最具代表性的正/负例单词

The Softmax

逻辑回归 = Softmax分类在给定词向量x的情况下获得y类的概率

The Softmax – 细节

术语：损失函数（Loss function) = 代价函数(Cost function) = 目标函数（Objective function)
Softmax的损失（Loss): 交叉熵（Cross Entropy)
如何计算p(y|x): 取W的y′行乘以含x的行
计算所有的fc, c = 1, 2, … , C
归一化计算Softmax函数的概率

Softmax和交叉熵误差

目标是最大化正确分类y的概率
因此，我们可以最小化改函数负的对数概率
因此，如果有多个类别我们可以在总的误差函数中叠加多个交叉熵误差

背景：交叉熵 & KL散度

假设分布是：p = [0,…,0,1,0,…0], 对应计算的概率分布是q，则交叉熵是：
因为p是one-hot的缘故，则上述公式剩余的则是真实类的负的对数概率
交叉熵可以写成熵和两个分布的KL散度之和
在我们的case里p是0（即使不是0也会因为它是固定的对梯度没有固定），最小化交叉熵等价于最小化KL散度
KL散度并非是一个距离函数而是一个对于两个概率分布差异的非对称的度量
维基百科：KL散度是两个概率分布P和Q差别的非对称性的度量。 KL散度是用来度量使用基于Q的编码来编码来自P的样本平均所需的额外的位元数。典型情况下，P表示数据的真实分布，Q表示数据的理论分布，模型分布，或P的近似分布。

简单的单个单词分类

例子：情感分析
两个选择：仅仅训练softmax权重W或者同时训练词向量
问题：训练词向量的优点和缺点是什么
Pro: 更好的适应训练数据
Con: 更差的泛化能力

训练的词向量的情感分享可视化

继续“打怪升级”：窗口分类（Window classification)

单个的单词没有上下文信息
通过对窗口中的中心词进行分类同时考虑窗口中的上下文
可能性：Softmax 和交叉熵误差或者最大边界损失（max-margin loss）
我们将在下一讲中探索这些问题(next class)

你可能感兴趣的:(DL+NLP)

对于规范和实现，你会混淆吗？ yangshangchuan HotSpot
昨晚和朋友聊天，喝了点咖啡，由于我经常喝茶，很长时间没喝咖啡了，所以失眠了，于是起床读JVM规范，读完后在朋友圈发了一条信息： JVM Run-Time Data Areas：The Java Virtual Machine defines various run-time data areas that are used during execution of a program. So
android 网络百合不是茶网络
android的网络编程和java的一样没什么好分析的都是一些死的照着写就可以了,所以记录下来方便查找 , 服务器使用的是TomCat 服务器代码; servlet的使用需要在xml中注册 package servlet; import java.io.IOException; import java.util.Arr
[读书笔记]读法拉第传 comsci 读书笔记
1831年的时候,一年可以赚到1000英镑的人..应该很少的... 要成为一个科学家,没有足够的资金支持,很多实验都无法完成但是当钱赚够了以后....就不能够一直在商业和市场中徘徊......
随机数的产生沐刃青蛟随机数
c++中阐述随机数的方法有两种：一是产生假随机数（不管操作多少次，所产生的数都不会改变）这类随机数是使用了默认的种子值产生的，所以每次都是一样的。 //默认种子 for (int i = 0; i < 5; i++) { cout<<
PHP检测函数所在的文件名 IT独行者 PHP 函数
很简单的功能，用到PHP中的反射机制，具体使用的是ReflectionFunction类，可以获取指定函数所在PHP脚本中的具体位置。创建引用脚本。代码： [php] view plain copy // Filename: functions.php <?php&nbs
银行各系统功能简介文强chu 金融
银行各系统功能简介　业务系统核心业务系统业务功能包括：总账管理、卡系统管理、客户信息管理、额度控管、存款、贷款、资金业务、国际结算、支付结算、对外接口等清分清算系统以清算日期为准，将账务类交易、非账务类交易的手续费、代理费、网络服务费等相关费用，按费用类型计算应收、应付金额，经过清算人员确认后上送核心系统完成结算的过程国际结算系
Python学习1(pip django 安装以及第一个project) 小桔子 python django pip
最近开始学习python,要安装个pip的工具。听说这个工具很强大，安装了它，在安装第三方工具的话so easy!然后也下载了，按照别人给的教程开始安装，奶奶的怎么也安装不上！第一步：官方下载pip-1.5.6.tar.gz, https://pypi.python.org/pypi/pip easy! 第二部：解压这个压缩文件，会看到一个setup.p
php 数组 aichenglong PHP 排序数组循环多维数组
1 php中的创建数组 $product = array('tires','oil','spark');//array()实际上是语言结构而不是函数 2 如果需要创建一个升序的排列的数字保存在一个数组中，可以使用range()函数来自动创建数组 $numbers=range(1,10)//1 2 3 4 5 6 7 8 9 10 $numbers=range(1,10,
安装python2.7 AILIKES python
安装python2.7 1、下载可从 http://www.python.org/进行下载#wget https://www.python.org/ftp/python/2.7.10/Python-2.7.10.tgz 2、复制解压 #mkdir -p /opt/usr/python #cp /opt/soft/Python-2
java异常的处理探讨百合不是茶 JAVA异常
//java异常 /* 1，了解java 中的异常处理机制，有三种操作 a,声明异常 b,抛出异常 c,捕获异常 2，学会使用try-catch-finally来处理异常 3，学会如何声明异常和抛出异常 4，学会创建自己的异常 */ //2，学会使用try-catch-finally来处理异常
getElementsByName实例 bijian1013 element
实例1： <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/x
探索JUnit4扩展：Runner bijian1013 java 单元测试 JUnit
参加敏捷培训时，教练提到Junit4的Runner和Rule，于是特上网查一下，发现很多都讲的太理论，或者是举的例子实在是太牵强。多搜索了几下，搜索到两篇我觉得写的非常好的文章。文章地址：http://www.blogjava.net/jiangshachina/archive/20
[MongoDB学习笔记二]MongoDB副本集 bit1129 mongodb
1. 副本集的特性 1)一台主服务器(Primary),多台从服务器(Secondary) 2)Primary挂了之后，从服务器自动完成从它们之中选举一台服务器作为主服务器，继续工作，这就解决了单点故障，因此，在这种情况下，MongoDB集群能够继续工作 3)挂了的主服务器恢复到集群中只能以Secondary服务器的角色加入进来 2
【Spark八十一】Hive in the spark assembly bit1129 assembly
Spark SQL supports most commonly used features of HiveQL. However, different HiveQL statements are executed in different manners: 1. DDL statements (e.g. CREATE TABLE, DROP TABLE, etc.)
Nginx问题定位之监控进程异常退出 ronin47
nginx在运行过程中是否稳定，是否有异常退出过？这里总结几项平时会用到的小技巧。 1. 在error.log中查看是否有signal项，如果有，看看signal是多少。比如，这是一个异常退出的情况： $grep signal error.log 2012/12/24 16:39:56 [alert] 13661#0: worker process 13666 exited on s
No grammar constraints (DTD or XML schema).....两种解决方法 byalias xml
方法一：常用方法关闭XML验证工具栏：windows => preferences => xml => xml files => validation => Indicate when no grammar is specified:选择Ignore即可。方法二：（个人推荐）添加内容如下 <?xml version=
Netty源码学习-DefaultChannelPipeline bylijinnan netty
package com.ljn.channel; /** * ChannelPipeline采用的是Intercepting Filter 模式 * 但由于用到两个双向链表和内部类，这个模式看起来不是那么明显，需要仔细查看调用过程才发现 * * 下面对ChannelPipeline作一个模拟，只模拟关键代码： */ public class Pipeline {
MYSQL数据库常用备份及恢复语句 chicony mysql
备份MySQL数据库的命令，可以加选不同的参数选项来实现不同格式的要求。 mysqldump -h主机 -u用户名 -p密码数据库名 > 文件备份MySQL数据库为带删除表的格式，能够让该备份覆盖已有数据库而不需要手动删除原有数据库。 mysqldump -–add-drop-table -uusername -ppassword databasename > ba
小白谈谈云计算--基于Google三大论文 CrazyMizzz Google 云计算 GFS
之前在没有接触到云计算之前，只是对云计算有一点点模糊的概念，觉得这是一个很高大上的东西，似乎离我们大一的还很远。后来有机会上了一节云计算的普及课程吧，并且在之前的一周里拜读了谷歌三大论文。不敢说理解，至少囫囵吞枣啃下了一大堆看不明白的理论。现在就简单聊聊我对于云计算的了解。我先说说GFS &n
hadoop 平衡空间设置方法 daizj hadoop balancer
在hdfs-site.xml中增加设置balance的带宽，默认只有1M： <property> <name>dfs.balance.bandwidthPerSec</name> <value>10485760</value> <description&g
Eclipse程序员要掌握的常用快捷键 dcj3sjt126com 编程
判断一个人的编程水平，就看他用键盘多，还是鼠标多。用键盘一是为了输入代码（当然了，也包括注释），再有就是熟练使用快捷键。曾有人在豆瓣评《卓有成效的程序员》：“人有多大懒，才有多大闲”。之前我整理了一个程序员图书列表，目的也就是通过读书，让程序员变懒。程序员作为特殊的群体，有的人可以这么懒，懒到事情都交给机器去做，而有的人又可以那么勤奋，每天都孜孜不倦得
Android学习之路 dcj3sjt126com Android学习
转自：http://blog.csdn.net/ryantang03/article/details/6901459 以前有J2EE基础，接触JAVA也有两三年的时间了，上手Android并不困难，思维上稍微转变一下就可以很快适应。以前做的都是WEB项目，现今体验移动终端项目，让我越来越觉得移动互联网应用是未来的主宰。下面说说我学习Android的感受，我学Android首先是看MARS的视
java 遍历Map的四种方法 eksliang java HashMap java 遍历Map的四种方法
转载请出自出处： http://eksliang.iteye.com/blog/2059996 package com.ickes; import java.util.HashMap; import java.util.Iterator; import java.util.Map; import java.util.Map.Entry; /** * 遍历Map的四种方式
【精典】数据库相关相关 gengzg 数据库
package C3P0; import java.sql.Connection; import java.sql.SQLException; import java.beans.PropertyVetoException; import com.mchange.v2.c3p0.ComboPooledDataSource; public class DBPool{
自动补全 huyana_town 自动补全
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"><html xmlns="http://www.w3.org/1999/xhtml&quo
jquery在线预览PDF文件，打开PDF文件天梯梦 jquery
最主要的是使用到了一个jquery的插件jquery.media.js，使用这个插件就很容易实现了。核心代码 <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.
ViewPager刷新单个页面的方法 lovelease android viewpager tag 刷新
使用ViewPager做滑动切换图片的效果时，如果图片是从网络下载的，那么再子线程中下载完图片时我们会使用handler通知UI线程，然后UI线程就可以调用mViewPager.getAdapter().notifyDataSetChanged()进行页面的刷新，但是viewpager不同于listview，你会发现单纯的调用notifyDataSetChanged()并不能刷新页面
利用按位取反（~）从复合枚举值里清除枚举值草料场 enum
以 C# 中的 System.Drawing.FontStyle 为例。如果需要同时有多种效果，如：“粗体”和“下划线”的效果，可以用按位或（|） FontStyle style = FontStyle.Bold | FontStyle.Underline; 如果需要去除 style 里的某一种效果，
Linux系统新手学习的11点建议刘星宇编程工作 linux 脚本
　　随着Linux应用的扩展许多朋友开始接触Linux，根据学习Windwos的经验往往有一些茫然的感觉：不知从何处开始学起。这里介绍学习Linux的一些建议。　　一、从基础开始：常常有些朋友在Linux论坛问一些问题，不过，其中大多数的问题都是很基础的。例如：为什么我使用一个命令的时候，系统告诉我找不到该目录，我要如何限制使用者的权限等问题，这些问题其实都不是很难的，只要了解了 Linu
hibernate dao层应用之HibernateDaoSupport二次封装 wangzhezichuan DAO Hibernate
/** * 方法描述:sql语句查询返回List<Class> * 方法备注: Class 只能是自定义类 * @param calzz * @param sql * @return * 创建人：王川 * 创建时间：Jul