深度学习与自然语言处理(7)_斯坦福cs224d 语言模型，RNN，LSTM与GRU

翻译：@胡杨(superhy199148@hotmail.com) && @胥可(feitongxiaoke@gmail.com)

说明：本文为斯坦福大学CS224d课程的中文版内容笔记，已得到斯坦福大学课程@Richard Socher教授的授权翻译与发表

1.语言模型

语言模型用于对特定序列的一系列词汇的出现概率进行计算。一个长度为m的词汇序列{w1,…,wm}的联合概率被表示为P(w1,…,wm)。由于在得到具体的词汇之前我们会先知道词汇的数量，词汇wi的属性变化会根据其在输入文档中的位置而定，而联合概率P(w1,…,wm)的计算通常只考虑包含n个前缀词的词窗口而非考虑全部的前缀词：

P (w 1, \dots, w m) = \prod i = 1 i = m P (w i | w 1, \dots, w i - 1) \approx \prod i = 1 i = m P (w i | w i - (n - 1), \dots, w i - 1) (1)

公式1在语音识别和机器翻译系统中对判定一组词序列是否为相应输入序列的正确生成结果有着极为重要的作用。在一个给定的机器翻译系统中，针对各个短语或句子的翻译任务，软件通常被要求生成一组替代词序列（例如：“我已经”；“我曾有”；“我有”；“被我已经”；“被我占有”）以及它们的得分以判定它们是否能组成最优的翻译序列。

在机器翻译任务中，模型通过计量和比较各个替换输出词序列之间的得分优劣，从它们中为输入短语寻找最佳的答案词序列。为了完成这项工作，模型需要经常在词排序和词选择两个任务模型之间切换。而上面提到的目标将通过为所有的候选词序列设置概率计算函数而达成，这个函数将比较这些候选词序列各自的得分。获得最高得分的候选词序列就是机器翻译任务的输出。例如：相比例句“小的这只猫真是”，机器会给例句“这只猫真小”更高的评分，相比“放学后步行去房子”，“放学后步行回家”会得到更高的得分。为了计算这些概率，将比较统计n元语言模型和词频模型的效果。比如，如果选择2元语言模型，语义2元组的词频通过统计当前词和其前面一个词，这就需要与1元语法模型的词频计算方法区分开来。公式2和3分别展示了2元语义模型和3元语义模型在处理这种关系时的做法。

p (w 2 | w 1) = c o u n t ( w 1 , w 2 ) c o u n t ( w 1 ) (2)

p (w 3 | w 1, w 2) = c o u n t ( w 1 , w 2 , w 3 ) c o u n t ( w 1 , w 2 ) (3)

公式3中表现出来的关系集中于基于上下文中固定窗口内容（例如：n个前缀词范围）对后续词的预测。在某些情况下，仅仅抽取n个前缀词作为窗口范围可能不足以很好地捕捉上下文信息。例如，当一篇文章在后段着重描写西班牙与法国的历史，而在前文中，当你读到“这两个国家走向了战争”这句话时，仅有此句的前文显然不能够让我们识别出这两个国家的命名实体。Bengio等人提出了第一个大规模的深度学习自然语言处理框架，此框架能够通过学习得到词汇的分布化表征捕捉上面提到的这种上下文关系；图1展示了这种神经网络的框架。在这个模型中，输入词向量在隐层和输出层均得到使用。公式4展示了引入标准tanh()函数的softmax()分类函数中的各个参数，这个函数起到线性分类器的作用，W(3)x+b(3),这一组短式代表全体前缀词的输入词向量。

y ̂ = s o f t m a x (W (2) t a n h (W (1) x + b (1)) + W (3) x + b (3)) (4)

来源: http://lib.csdn.net/article/deeplearning/45380

与本文相关文章

暂无,快来抢沙发吧！