10.2 近似训练
回忆上一节的内容。跳字模型的核心在于使用softmax运算得到给定中心词wc来生成背景词wo的条件概率
P(wo∣wc)=∑i∈Vexp(ui⊤vc)exp(uo⊤vc).
该条件概率相应的对数损失
−logP(wo∣wc)=−uo⊤vc+log(i∈V∑exp(ui⊤vc)).
由于softmax运算考虑了背景词可能是词典V中的任一词,以上损失包含了词典大小数目的项的累加。在上一节中我们看到,不论是跳字模型还是连续词袋模型,由于条件概率使用了softmax运算,每一步的梯度计算都包含词典大小数目的项的累加。对于含几十万或上百万词的较大词典,每次的梯度计算开销可能过大。为了降低该计算复杂度,本节将介绍两种近似训练方法,即负采样(negative sampling)或层序softmax(hierarchical softmax)。由于跳字模型和连续词袋模型类似,本节仅以跳字模型为例介绍这两种方法。
10.2.1 负采样
负采样修改了原来的目标函数。给定中心词wc的一个背景窗口,我们把背景词wo出现在该背景窗口看作一个事件,并将该事件的概率计算为
P(D=1∣wc,wo)=σ(uo⊤vc),
其中的σ函数与sigmoid激活函数的定义相同:
σ(x)=1+exp(−x)1.
我们先考虑最大化文本序列中所有该事件的联合概率来训练词向量。具体来说,给定一个长度为T的文本序列,设时间步t的词为w(t)且背景窗口大小为m,考虑最大化联合概率
∏t=1T∏−m≤j≤m, j=0P(D=1∣w(t),w(t+j)).
然而,以上模型中包含的事件仅考虑了正类样本。这导致当所有词向量相等且值为无穷大时,以上的联合概率才被最大化为1。很明显,这样的词向量毫无意义。负采样通过采样并添加负类样本使目标函数更有意义。设背景词wo出现在中心词wc的一个背景窗口为事件P,我们根据分布P(w)采样K个未出现在该背景窗口中的词,即噪声词。设噪声词wk(k=1,…,K)不出现在中心词wc的该背景窗口为事件Nk。假设同时含有正类样本和负类样本的事件P,N1,…,NK相互独立,负采样将以上需要最大化的仅考虑正类样本的联合概率改写为
∏t=1T∏−m≤j≤m, j=0P(w(t+j)∣w(t)),
其中条件概率被近似表示为
P(w(t+j)∣w(t))=P(D=1∣w(t),w(t+j))∏k=1, wk∼P(w)KP(D=0∣w(t),wk).
设文本序列中时间步t的词w(t)在词典中的索引为it,噪声词wk在词典中的索引为hk。有关以上条件概率的对数损失为
−logP(w(t+j)∣w(t))===−logP(D=1∣w(t),w(t+j))−k=1, wk∼P(w)∑KlogP(D=0∣w(t),wk)−logσ(uit+j⊤vit)−k=1, wk∼P(w)∑Klog(1−σ(uhk⊤vit))−logσ(uit+j⊤vit)−k=1, wk∼P(w)∑Klogσ(−uhk⊤vit).
现在,训练中每一步的梯度计算开销不再与词典大小相关,而与K线性相关。当K取较小的常数时,负采样在每一步的梯度计算开销较小。
10.2.2 层序softmax
层序softmax是另一种近似训练法。它使用了二叉树这一数据结构,树的每个叶结点代表词典V中的每个词。
假设L(w)为从二叉树的根结点到词w的叶结点的路径(包括根结点和叶结点)上的结点数。设n(w,j)为该路径上第j个结点,并设该结点的背景词向量为un(w,j)。以图10.3为例,L(w3)=4。层序softmax将跳字模型中的条件概率近似表示为
P(wo∣wc)=∏j=1L(wo)−1σ([[n(wo,j+1)=leftChild(n(wo,j))]]⋅un(wo,j)⊤vc),
其中σ函数与3.8节(多层感知机)中sigmoid激活函数的定义相同,leftChild(n)是结点n的左子结点:如果判断x为真,[[x]]=1;反之[[x]]=−1。
让我们计算图10.3中给定词wc生成词w3的条件概率。我们需要将wc的词向量vc和根结点到w3路径上的非叶结点向量一一求内积。由于在二叉树中由根结点到叶结点w3的路径上需要向左、向右再向左地遍历(图10.3中加粗的路径),我们得到
P(w3∣wc)=σ(un(w3,1)⊤vc)⋅σ(−un(w3,2)⊤vc)⋅σ(un(w3,3)⊤vc).
由于σ(x)+σ(−x)=1,给定中心词wc生成词典V中任一词的条件概率之和为1这一条件也将满足:
∑w∈VP(w∣wc)=1.
此外,由于L(wo)−1的数量级为O(log2∣V∣),当词典V很大时,层序softmax在训练中每一步的梯度计算开销相较未使用近似训练时大幅降低。
小结
- 负采样通过考虑同时含有正类样本和负类样本的相互独立事件来构造损失函数。其训练中每一步的梯度计算开销与采样的噪声词的个数线性相关。
- 层序softmax使用了二叉树,并根据根结点到叶结点的路径来构造损失函数。其训练中每一步的梯度计算开销与词典大小的对数相关。
注:本节与原书完全相同,原书传送门