序列到序列的学习 (seq2seq - 词嵌入 - Embedding层 - mask掩码 - 评估指标BLEU) + 代码实现 —— 笔记3.10《动手学深度学习》
目录
0. 前言
- 课程全部代码(pytorch版)已上传到附件
- 本章节为原书第9章(现代循环网络),共分为8节,本篇是第7节:序列到序列的学习
- 本节的代码位置为:chapter_recurrent-modern/seq2seq.ipynb
- 本节的视频链接:62 序列到序列学习(seq2seq)【动手学深度学习v2】
正如我们在 :numref:sec_machine_translation中看到的, 机器翻译中的输入序列和输出序列都是长度可变的。 为了解决这类问题,我们在 :numref:sec_encoder-decoder中 设计了一个通用的”编码器-解码器“架构。 本节,我们将使用两个循环神经网络的编码器和解码器, 并将其应用于序列到序列(sequence to sequence,seq2seq)类的学习任务 :cite:Sutskever.Vinyals.Le.2014,Cho.Van-Merrienboer.Gulcehre.ea.2014。
遵循编码器-解码器架构的设计原则, 循环神经网络编码器使用长度可变的序列作为输入, 将其转换为固定形状的隐状态。 换言之,输入序列的信息被编码到循环神经网络编码器的隐状态中。 为了连续生成输出序列的词元, 独立的循环神经网络解码器是基于输入序列的编码信息 和输出序列已经看见的或者生成的词元来预测下一个词元。 :numref:fig_seq2seq演示了 如何在机器翻译中使用两个循环神经网络进行序列到序列学习。

:label:fig_seq2seq
在 :numref:fig_seq2seq中, 特定的“<eos>”表示序列结束词元。 一旦输出序列生成此词元,模型就会停止预测。 在循环神经网络解码器的初始化时间步,有两个特定的设计决定: 首先,特定的“<bos>”表示序列开始词元,它是解码器的输入序列的第一个词元。 其次,使用循环神经网络编码器最终的隐状态来初始化解码器的隐状态。 例如,在 :cite:Sutskever.Vinyals.Le.2014的设计中, 正是基于这种设计将输入序列的编码信息送入到解码器中来生成输出序列的。 在其他一些设计中 :cite:Cho.Van-Merrienboer.Gulcehre.ea.2014, 如 :numref:fig_seq2seq所示, 编码器最终的隐状态在每一个时间步都作为解码器的输入序列的一部分。 类似于 :numref:sec_language_model中语言模型的训练, 可以允许标签成为原始的输出序列, 从源序列词元“<bos>”“Ils”“regardent”“.” 到新序列词元 “Ils”“regardent”“.”“<eos>”来移动预测的位置。
- 从计算损失的角度理解,输入英语(编码器输入)+法语(解码器输入),得出的法语预测;
- 当整个法语句子的预测完成后,会将预测的法语句子和真实的法语输入句子进行比较来做损失(如交叉熵)。
- 在序列到序列学习中,解码器的输入(本篇用到的)可以是真值(教师强制模式-收敛快),也可以是上个时间步输出的预测值(学得慢-性能好)
下面,我们动手构建 :numref:fig_seq2seq的设计, 并将基于 :numref:sec_machine_translation中 介绍的“英-法”数据集来训练这个机器翻译模型。
In [1]:
import collections
import math
import torch
from torch import nn
from d2l import torch as d2l
1. 编码器 (encoder)
从技术上讲,编码器将长度可变的输入序列转换成 形状固定的上下文变量𝐜, 并且将输入序列的信息在该上下文变量中进行编码。 如 :numref:fig_seq2seq所示,可以使用循环神经网络来设计编码器。

到目前为止,我们使用的是一个单向循环神经网络来设计编码器, 其中隐状态只依赖于输入子序列, 这个子序列是由输入序列的开始位置到隐状态所在的时间步的位置 (包括隐状态所在的时间步)组成。 我们也可以使用双向循环神经网络构造编码器, 其中隐状态依赖于两个输入子序列, 两个子序列是由隐状态所在的时间步的位置之前的序列和之后的序列 (包括隐状态所在的时间步), 因此隐状态对整个序列的信息都进行了编码。
补充1:词嵌入 (Word Embedding)
( 通过特定的词嵌入降维算法,如word2vec等训练一个通用的嵌入矩阵-即embedding层,这个视频讲得很好:什么是词嵌入,Word Embedding算法_哔哩哔哩_bilibili)
相比之前在RNN小节中用到的One-Hot编码:
- 词嵌入相当于将高维稀疏的one-hot降维变稠密:
- 下图中矩阵V是独热编码后的4个词向量,很稀疏很长
- 词表大小 (vocab_size) = 5000
- 矩阵E是embedding层,将5000降维成128,大大减小了计算量
- 嵌入层大小 (embed_size) = 128
- 词嵌入在降维的同时,相似的词在向量空间上也会更相近
- 嵌入层 (参数矩阵E) 是很泛用的:同一份词向量+对应词表,可以用在不同的NLP任务中
- 嵌入层,在Embedding层,pytorch框架层面可以理解为没有bias(偏置)的Linear层
现在,让我们[实现循环神经网络编码器]。 注意,我们使用了嵌入层(embedding layer) 来获得输入序列中每个词元的特征向量。 嵌入层的权重是一个矩阵, 其行数等于输入词表的大小(
vocab_size), 其列数等于特征向量的维度(embed_size)。 对于任意输入词元的索引𝑖, 嵌入层获取权重矩阵的第𝑖行(从0开始)以返回其特征向量。 另外,本文选择了一个多层门控循环单元 GRU 来实现编码器。
In [2]:
#@save
class Seq2SeqEncoder(d2l.Encoder): # d2l.Encoder父类主要是继承了nn.Module,别的没啥
"""用于序列到序列学习的循环神经网络编码器"""
def __init__(self, vocab_size, embed_size, num_hiddens, num_layers,
dropout=0, **kwargs):
super(Seq2SeqEncoder, self).__init__(**kwargs) # 固定么写就是为了Seq2SeqEncoder继承父类d2l.Encoder
# 嵌入层,从 vocab_size → embed_size 大幅度降维
self.embedding = nn.Embedding(vocab_size, embed_size) # 参考上面的"补充1:词嵌入"和"补充2:嵌入层"
self.rnn = nn.GRU(embed_size, num_hiddens, num_layers, # num_layers即"深层RNN"小节里的
dropout=dropout) # 加入丢弃层
# 编码器部分不需要输出,所以没有输出层
# 编码器主要的输出是RNN(GRU)层最后的隐藏表示,传给解码器
def forward(self, X, *args):
# 输出'X'的形状:(batch_size,num_steps,embed_size)
X = self.embedding(X)
# 在循环神经网络模型中,第一个轴对应于时间步
X = X.permute(1, 0, 2) # (RNN小节有讲) 把时间步维度提前, 这样方便for循环逐个时间步,来训练
# 如果未提及状态,则默认为0
output, state = self.rnn(X)
# output的形状:(时间步数,批量大小,隐藏单元数),是拼接每个时间步的输出隐状态成list;用来算上下文变量c
# state的形状:(num_layers,batch_size,num_hiddens),是最后一个时间步,RNN(GRU)层输出的隐藏状态s
return output, state # 需要结合前几个小节的知识才能透彻理解
循环层返回变量的说明可以参考 :numref:sec_rnn-concise。
下面,我们实例化[上述编码器的实现]: 我们使用一个两层门控循环单元编码器,其隐藏单元数为16。 给定一小批量的输入序列 X(批量大小为4,时间步为7)。 在完成所有时间步后, 最后一层的隐状态的输出是一个张量(output由编码器的循环层返回), 其形状为(时间步数,批量大小,隐藏单元数)。
In [3]:
encoder = Seq2SeqEncoder(vocab_size=10, embed_size=8, num_hiddens=16,
num_layers=2)
encoder.eval() # 评估模式,dropout不会生效,有/没有这行,都问题不大;torch.long转换为64位整数(int是32位)
X = torch.zeros((4, 7), dtype=torch.long) # batch_size = 4, num_steps(时间步数 = token数量 = 句长) = 7
output, state = encoder(X) # 因为有嵌入层做索引,所以不用做one-hot,可参考上面的"补充2:嵌入层"
# output在本篇中貌似用不到;能传入解码器、作为上下文变量c的是state的最后一层
# 但output在注意力机制的seq2seq里会用到,这是下一章的内容啦
output.shape # (编码器)拼接每个时间步的输出,形状 =(时间步数,批量大小,隐藏单元数)= (7, 4, 16)
Out[3]:
torch.Size([7, 4, 16])
补充2:嵌入层 (Embedding Layer)
在pytorch中,嵌入层的真正输入并不是one-hot编码后的矩阵V,这一步one-hot编码会通过根据token在词表中的索引,在权重矩阵E中索引到对应token的行,的方式更快地运算:
- 假设
vocab_size = 10(词表大小),embed_size = 8(嵌入维度)
batch_size= 4(批量大小),num_steps= 7(时间步数 = token数量 = 句长)- 当创建
embedding = torch.nn.Embedding(10, 8)
- 它会有一个形状为
(10, 8)的权重矩阵E- 现在假设有一个输入张量
X,形状为(4, 7) = (batch_size,num_steps),其中X中的元素是token在词表中的索引
- 例如
X[0][0] = 9,X[0][1] = 6等- 当执行
X = embedding(X)时,对于X中的每个token的索引(如X[0][0] = 9)
Embedding层会在其权重矩阵中查找第 10 行(索引从 0 开始)- 这一行的形状是
(8,),然后将其作为输出张量X在相应位置的嵌入向量- 最终嵌入层的输出
X的形状变为(batch_size, num_steps, embed_size)
- 即
(4, 7, 8)。在这个过程中,通过索引查找和填充操作来实现维度转换(编码)
由于这里使用的是门控循环单元, 所以在最后一个时间步的多层隐状态的形状是 (隐藏层的数量,批量大小,隐藏单元的数量)。 如果使用长短期记忆网络,state中还将包含记忆单元信息。
In [4]:
state.shape # (编码器)最后一个时间步的隐藏状态 = (隐藏层数,批量大小,隐藏单元数)
# 隐藏层数(num_layers)的概念在"深层RNN"小节里
Out[4]:
torch.Size([2, 4, 16])
2. 解码器 (decoder)
:label:sec_seq2seq_decoder

:eqlabel:eq_seq2seq_s_t

根据 :numref:fig_seq2seq,当实现解码器时, 我们直接使用编码器最后一个时间步的隐状态来初始化解码器的隐状态。 这就要求使用循环神经网络实现的编码器和解码器具有相同数量的层和隐藏单元。 为了进一步包含经过编码的输入序列的信息, 上下文变量𝐜在所有的时间步与解码器的输入(法语预测值)进行拼接(concatenate)。 为了预测输出词元的概率分布, 在循环神经网络解码器的最后一层(输出层)使用全连接层来变换隐状态𝐬𝑡′。
In [5]:
class Seq2SeqDecoder(d2l.Decoder): # # d2l.Decoder父类主要是继承了nn.Module
"""用于序列到序列学习的循环神经网络解码器"""
def __init__(self, vocab_size, embed_size, num_hiddens, num_layers,
dropout=0, **kwargs):
super(Seq2SeqDecoder, self).__init__(**kwargs)
self.embedding = nn.Embedding(vocab_size, embed_size) # 这和编码器的嵌入层独立,因为是法语
self.rnn = nn.GRU(embed_size + num_hiddens, num_hiddens, num_layers,
dropout=dropout) # 关于为啥“embed_size + num_hiddens”,看forward()
self.dense = nn.Linear(num_hiddens, vocab_size) # 输出层
def init_state(self, enc_outputs, *args): # 这里传入的enc_outputs是有两个元素的 tuple = (output, state)
return enc_outputs[1] # enc_outputs[1]相当于取state(这是编码器最后时间步的隐状态)
# 在本篇中的GRU有两层,隐藏层数设置为2,形状 = (隐藏层数,批量大小,隐藏单元数)
# 这里的state会传入到forward函数中的state
def forward(self, X, state): # 传入的X是目标target,即法语X = (batch_size,num_steps)
# 输出'X'的形状:(num_steps,batch_size,embed_size)
X = self.embedding(X).permute(1, 0, 2) # 法语embedding层,把时间步数的维度提前
# state[-1]取最后一层的隐状态,形状 = (批量大小,隐藏单元数) 这具有编码后的全部信息
# 广播state[-1],使其具有与X相同的num_steps;repeat复制num_steps次,1, 1指后两维不复制
context = state[-1].repeat(X.shape[0], 1, 1) # context的形状 = (num_steps,batch_size,num_hiddens)
# 上面算出来的context就是编码器最后时间步最后一层的隐状态,广播到词嵌入后的维度,但是最内层维度不同
# 因为最内层维度dim=2 cat拼起来,X_and_context形状 = (num_steps,batch_size,embed_size+num_hiddens)
X_and_context = torch.cat((X, context), 2)
output, state = self.rnn(X_and_context, state) # GRU层逐一迭代每个时间步
output = self.dense(output).permute(1, 0, 2) # 输出就把batch_size提前,前两维做回到输入法语X的形状
# output的形状:(batch_size,num_steps,vocab_size) # vocab_size方便到词表中索引token
# state的形状:(num_layers,batch_size,num_hiddens)
return output, state
下面,我们用与前面提到的编码器中相同的超参数来[实例化解码器]。 如我们所见,解码器的输出形状变为(批量大小,时间步数,词表大小), 其中张量的最后一个维度存储预测的词元分布。
In [6]:
decoder = Seq2SeqDecoder(vocab_size=10, embed_size=8, num_hiddens=16,
num_layers=2)
decoder.eval()
state = decoder.init_state(encoder(X))
output, state = decoder(X, state)
output.shape, state.shape # output中的10是经过了dense layer 输出层(线性层)的输出
# 4是batch_size样本数,7是时间步数(句子长度);2是隐藏层数(2层GRU),16是每层GRU的隐藏单元数
Out[6]:
(torch.Size([4, 7, 10]), torch.Size([2, 4, 16]))
总之,上述循环神经网络“编码器-解码器”模型中的各层如 :numref:fig_seq2seq_details所示。

:label:fig_seq2seq_details
3. 损失函数 (加入mask掩码)
在每个时间步,解码器预测了输出词元的概率分布。 类似于语言模型,可以使用softmax来获得分布, 并通过计算交叉熵损失函数来进行优化。 回想一下 :numref:sec_machine_translation中, 特定的填充词元被添加到序列的末尾, 因此不同长度的序列可以以相同形状的小批量加载。 但是,我们应该将填充词元的预测排除在损失函数的计算之外。
为此,我们可以使用下面的sequence_mask函数 [通过零值化屏蔽不相关的项], 以便后面任何不相关预测的计算都是与零的乘积,结果都等于零。 例如,如果两个序列的有效长度(不包括填充词元)分别为1和2, 则第一个序列的第一项和第二个序列的前两项之后的剩余项将被清除为零。
In [7]:
#@save
def sequence_mask(X, valid_len, value=0): # mask掩码,比如把<pad>没用的屏蔽掉,把这些元素设为0
"""在序列中屏蔽不相关的项""" # 根据输入的valid_len有效长度,把X句尾词元<eos>及之后的token设为value=0
maxlen = X.size(1) # 获取张量的大小信息,X的形状(2,3),X.size(1)返回值 = 3
# 若 X 形状为 (batch_size, sequence_length) 的张量,那么 maxlen 就等于这个 sequence_length
mask = torch.arange((maxlen), dtype=torch.float32,
device=X.device)[None, :] < valid_len[:, None] # [None, :]增加最外层维度
# maxlen = 3,arange((maxlen))创建的张量= torch.tensor([0., 1., 2.])
# 后接[None, :]操作,形状为 (1, maxlen),即 torch.tensor([[0., 1., 2.]])
# valid_len[:, None]操作后,形状为 (batch_size, 1),即torch.tensor([[1], [2]])
# torch.arange((maxlen))[None, :] < valid_len[:, None] 判断大小会对左右两边进行广播,输出为布尔型bool
# 输出为:torch.tensor([[True, False, False], [True, True, False]])
X[~mask] = value # 根据布尔掩码 mask 对张量 X 进行元素级别的修改
# ~mask 反掩码将 True → False,False → True,X[~mask]索引到True的位置的元素赋值输入 value = 0
return X
X = torch.tensor([[1, 2, 3], [4, 5, 6]]) # (batch_size,num_steps) = (2,3)
sequence_mask(X, torch.tensor([1, 2])) # 1和2指的都是每行(样本)的有效长度
Out[7]:
tensor([[1, 0, 0],
[4, 5, 0]])
(我们还可以使用此函数屏蔽最后几个轴上的所有项。)如果愿意,也可以使用指定的非零值来替换这些项。
In [8]:
X = torch.ones(2, 3, 4) # 额外的演示,2是batch_size样本数,3是时间步数(句子长度),4是词表大小
sequence_mask(X, torch.tensor([1, 2]), value=-1) # decoder输出的output有很多时间步是填充的,可以按行替换
Out[8]:
tensor([[[ 1., 1., 1., 1.],
[-1., -1., -1., -1.],
[-1., -1., -1., -1.]],
[[ 1., 1., 1., 1.],
[ 1., 1., 1., 1.],
[-1., -1., -1., -1.]]])
现在,我们可以[通过扩展softmax交叉熵损失函数来遮蔽不相关的预测]。 最初,所有预测词元的掩码都设置为1。 一旦给定了有效长度,与填充词元对应的掩码将被设置为0。 最后,将所有词元的损失乘以掩码,以过滤掉损失中填充词元产生的不相关预测。
In [9]:
#@save
class MaskedSoftmaxCELoss(nn.CrossEntropyLoss):
"""带遮蔽的softmax交叉熵损失函数"""
# pred的形状:(batch_size,num_steps,vocab_size) - 预测的法语(里面有很多填充的时间步,需要musk掉)
# label的形状:(batch_size,num_steps) - 法语答案
# valid_len的形状:(batch_size,) - 一个batch里每个样本(句子)有效的长度
def forward(self, pred, label, valid_len):
weights = torch.ones_like(label) # 生成和label形状一样的全1 tensor = (batch_size,num_steps)
weights = sequence_mask(weights, valid_len) # 保留有效的句子长度,该长度之后的都设为0(默认)
# 得到的weights形状 = (batch_size,num_steps),其中无效的token(num_steps)被设为0
self.reduction='none' # nn.CrossEntropyLoss框架中默认reduction方式是 'mean',
# 即对小批量里的每个样本的损失平均成1个数,每个批量的损失就返回一个平均数;
# reduction设置为'none',返回的形状与输入的标签(label)的样本(批量大小)维形状相同 = (batch_size,)
unweighted_loss = super(MaskedSoftmaxCELoss, self).forward( # super调用父类损失函数,传入预测与标签
pred.permute(0, 2, 1), label) # pytorch框架需要把预测维(词表大小维)放在中间
# 得到未加权的损失unweighted_loss,形状 = (batch_size,)
# 未加权损失,广播,得到每个样本加权后损失,求均值前形状 = (batch_size,num_steps)
weighted_loss = (unweighted_loss * weights).mean(dim=1) # 按照num_steps维求均值,形状=(batch_size,)
return weighted_loss
我们可以创建三个相同的序列来进行[代码健全性检查], 然后分别指定这些序列的有效长度为4、2和0。 结果就是,第一个序列的损失应为第二个序列的两倍,而第三个序列的损失应为零。
In [10]:
loss = MaskedSoftmaxCELoss() # 代码健全性检查
loss(torch.ones(3, 4, 10), torch.ones((3, 4), dtype=torch.long),
torch.tensor([4, 2, 0])) # 看输出的损失是否成比例4:2:0
Out[10]:
tensor([2.3026, 1.1513, 0.0000])
4. 训练 (解码器用真值)
:label:sec_seq2seq_training
在下面的循环训练过程中,如 :numref:fig_seq2seq所示, 特定的序列开始词元(“<bos>”)和 原始的输出序列(不包括序列结束词元“<eos>”) 拼接在一起作为解码器的输入。
- 法1:这被称为强制教学(teacher forcing), 因为原始的输出序列(词元的标签)被送入解码器。(本篇用到的)
- 法2:或者,将来自上一个时间步的预测得到的词元作为解码器的当前输入。
- 在序列到序列学习中,解码器的输入(本篇用到的法1)可以是真值(法1-教师强制模式-收敛快)
- 也可以是上个时间步输出的预测值(法2-学得慢-性能好)
- 在代码上,强制教学体现在class Seq2SeqDecoder()里,train_seq2seq()也有
In [11]:
#@save
def train_seq2seq(net, data_iter, lr, num_epochs, tgt_vocab, device):
"""训练序列到序列模型"""
def xavier_init_weights(m): # 权重初始化 - 定义
if type(m) == nn.Linear:
nn.init.xavier_uniform_(m.weight)
if type(m) == nn.GRU:
for param in m._flat_weights_names:
if "weight" in param:
nn.init.xavier_uniform_(m._parameters[param])
net.apply(xavier_init_weights) # 权重初始化
net.to(device) # 放到GPU上
optimizer = torch.optim.Adam(net.parameters(), lr=lr) # pytorch框架里的Adam自适应学习率的优化算法
loss = MaskedSoftmaxCELoss() # 到了Masked的损失,封装(包)了好几层class
net.train() # encoder和decoder都封装成net;将模型(net)设置为训练模式,启用dropout
animator = d2l.Animator(xlabel='epoch', ylabel='loss',
xlim=[10, num_epochs]) # 画图
for epoch in range(num_epochs):
timer = d2l.Timer() # 开始计时
metric = d2l.Accumulator(2) # 训练损失总和,词元数量
for batch in data_iter: # 从“机器翻译数据集”迭代器里取数据,可参考上一小节
optimizer.zero_grad() # 梯度设为0
X, X_valid_len, Y, Y_valid_len = [x.to(device) for x in batch] # 返回X和Y,以及各自有效长度
# X和Y的形状 = (batch_size,num_steps);X和Y的valid_len形状 = (batch_size,)
# 构建decoder的输入(法语)数据dec_input,做“强制教学”的输入数据,输入真值
# 在法语每行样本(句子)前添加开始词元<bos>,tgt_vocab['<bos>']在法语词表中找到'<bos>'的索引
# [tgt_vocab['<bos>']] 创建了一个只包含开始词元 <bos> 索引的列表,形状是(1,)
# 然后"*"对该元素在列表里重复Y.shape[0]=batch_size次,bos是形状为(batch_size,)的list
bos = torch.tensor([tgt_vocab['<bos>']] * Y.shape[0],
device=device).reshape(-1, 1)
# Y[:, :-1]]取最后一列之外的所有列(删除Y最后的列:时间步),把bos在列(dim=1)上拼到Y[:, :-1]]的前面
dec_input = torch.cat([bos, Y[:, :-1]], 1) # dec_input形状恢复(batch_size,num_steps)
# 以上三行是在做“强制教学”的输入数据,输入真值,在句首加上开始词元'<bos>'
Y_hat, _ = net(X, dec_input, X_valid_len) # 后面attention的时候会用X_valid_len,本篇还用不上
l = loss(Y_hat, Y, Y_valid_len) # 输入和输出需参考:MaskedSoftmaxCELoss
# 从这里到上面“构建decoder的输入”是与RNN主要的不同,理解很费时间,需要结之前定义的函数&类
# 输出的(掩码)加权loss = (batch_size,),需要sum()求和
l.sum().backward() # 损失函数的标量进行“反向传播”
d2l.grad_clipping(net, 1) # 梯度剪裁,RNN小节有讲
num_tokens = Y_valid_len.sum()
optimizer.step()
with torch.no_grad():
metric.add(l.sum(), num_tokens)
if (epoch + 1) % 10 == 0:
animator.add(epoch + 1, (metric[0] / metric[1],))
print(f'loss {metric[0] / metric[1]:.3f}, {metric[1] / timer.stop():.1f} '
f'tokens/sec on {str(device)}')
现在,在机器翻译数据集上,我们可以 [创建和训练一个循环神经网络“编码器-解码器”模型]用于序列到序列的学习。
In [12]:
embed_size, num_hiddens, num_layers, dropout = 32, 32, 2, 0.1
batch_size, num_steps = 64, 10
lr, num_epochs, device = 0.005, 300, d2l.try_gpu() # 超参数比之前RNN多一些
# 从“机器翻译数据集”迭代器里取数据,可参考上一小节
train_iter, src_vocab, tgt_vocab = d2l.load_data_nmt(batch_size, num_steps)
encoder = Seq2SeqEncoder(len(src_vocab), embed_size, num_hiddens, num_layers,
dropout)
decoder = Seq2SeqDecoder(len(tgt_vocab), embed_size, num_hiddens, num_layers,
dropout)
net = d2l.EncoderDecoder(encoder, decoder)
train_seq2seq(net, train_iter, lr, num_epochs, tgt_vocab, device) # 咱没做validation,简化易理解
# 看图中结果,到后面基本上over fitting了,把句子给记住了
loss 0.020, 13959.5 tokens/sec on cuda:0

5. 预测 (解码器输入上个预测)
为了采用一个接着一个词元的方式预测输出序列, 每个解码器当前时间步的输入都将来自于前一时间步的预测词元。 与训练类似,序列开始词元(“<bos>”) 在初始时间步被输入到解码器中。 该预测过程如 :numref:fig_seq2seq_predict所示, 当输出序列的预测遇到序列结束词元(“<eos>”)时,预测就结束了。

:label:fig_seq2seq_predict
我们将在 :numref:sec_beam-search中介绍不同的序列生成策略。
In [13]:
#@save
def predict_seq2seq(net, src_sentence, src_vocab, tgt_vocab, num_steps, # num_steps最大句子长度,前面设为10
device, save_attention_weights=False): # 预测模式没有batch_size了
"""序列到序列模型的预测"""
# 在预测时将net设置为评估模式
net.eval()
# src_sentence是一会儿做翻译预测法语时,咱输入的英文短句;lower()转成小写,按照' '空格切分成list,
src_tokens = src_vocab[src_sentence.lower().split(' ')] + [
src_vocab['<eos>']] # 在句尾"+"加上结束词元'<eos>'对应英文(源source)src_词表索引
# 做成有效encoder输入(英文句)长度,之后attention小节会用,咱先存在这儿
enc_valid_len = torch.tensor([len(src_tokens)], device=device)
# 填充/截断, 源代码在"机器翻译数据集"小节(本篇的上一篇),num_steps需要填充/截断到的长度,前面已设为10
src_tokens = d2l.truncate_pad(src_tokens, num_steps, src_vocab['<pad>']) # 输出形状 = (num_steps,)
# 添加批量轴,没有批量维,模型前面定义的模型跑不起来
enc_X = torch.unsqueeze( # torch.tensor,给src_tokens创建张量 = (num_steps,),再unsqueeze在dim=0最外层,
torch.tensor(src_tokens, dtype=torch.long, device=device), dim=0) # 增加一个维度 = (1, num_steps)
# 从net.encoder编码器中,得到output(编码器的output没用)和state(最后一个时间步的隐状态,咱设置的有两层)
enc_outputs = net.encoder(enc_X, enc_valid_len) # enc_X = (1, num_steps)传入encoder
# 用net.decoder类中init_state方法取出state,(初始化)作为decoder第0个时间步输入的隐状态
dec_state = net.decoder.init_state(enc_outputs, enc_valid_len)
# encoder可以像RNN那样,整个句子丢进去,decoder不行,预测模式下decoder的输入来自于上个时间步输出(的法语)
# 初始化解码器每个时间步的输出,在最前面添加开始词元'<bos>',并用unsqueeze添加批量轴在dim=0
dec_X = torch.unsqueeze(torch.tensor(
[tgt_vocab['<bos>']], dtype=torch.long, device=device), dim=0)
# 输出序列,和注意力权重(稍后讨论)
output_seq, attention_weight_seq = [], []
for _ in range(num_steps): # 对于每个时间步,从0按顺序循环
# Y和dec_state,是decoder每个时间步输出的output, state
# output的形状:(batch_size=1,num_steps=1,vocab_size) # vocab_size方便到词表中索引token
# state的形状:(num_layers,batch_size=1,num_hiddens)
Y, dec_state = net.decoder(dec_X, dec_state)
# 我们使用具有预测最高可能性的词元,作为解码器在下一时间步的输入
# 取output = Y 中 vocab_size维上最大值的索引,类似于nn.Embedding层的取索引
dec_X = Y.argmax(dim=2) # 形状 = (batch_size, num_steps) = (1,1)
# squeeze移除张量dec_X中维度大小为 1 的维度,这里指定dim=0(即batch_size维)
# item()函数将只有一个元素的张量dec_X.squeeze(dim=0)转换成type(torch.int32)的整型int整数
pred = dec_X.squeeze(dim=0).type(torch.int32).item() # 输出一个整数,即token在词表中的索引
# 保存注意力权重(稍后讨论)
if save_attention_weights:
attention_weight_seq.append(net.decoder.attention_weights)
# 一旦序列结束词元被预测,输出序列的生成就完成了
if pred == tgt_vocab['<eos>']:
break
# 把解码器每个时间步的pred拼接到dec_X,append拼成list
output_seq.append(pred)
# 根据output_seq的索引,在词表中把(法语单词)token找到,join把list拼接成一个字符串,用' '分隔
return ' '.join(tgt_vocab.to_tokens(output_seq)), attention_weight_seq
6. 翻译结果的评估 (BLEU)
我们可以通过与真实的标签序列进行比较来评估预测序列。 虽然 :cite:Papineni.Roukos.Ward.ea.2002 提出的BLEU(bilingual evaluation understudy) 最先是用于评估机器翻译的结果, 但现在它已经被广泛用于测量许多应用的输出序列的质量。 原则上说,对于预测序列中的任意𝑛元语法(n-grams), BLEU的评估都是这个𝑛元语法是否出现在标签序列中。
我们将BLEU定义为:

[BLEU的代码实现]如下。
In [14]:
def bleu(pred_seq, label_seq, k): #@save
"""计算BLEU""" # 不是特别重要,大概知道在干啥就行啦,之后直接掉包
pred_tokens, label_tokens = pred_seq.split(' '), label_seq.split(' ')
len_pred, len_label = len(pred_tokens), len(label_tokens)
score = math.exp(min(0, 1 - len_label / len_pred))
for n in range(1, k + 1):
num_matches, label_subs = 0, collections.defaultdict(int)
for i in range(len_label - n + 1):
label_subs[' '.join(label_tokens[i: i + n])] += 1
for i in range(len_pred - n + 1):
if label_subs[' '.join(pred_tokens[i: i + n])] > 0:
num_matches += 1
label_subs[' '.join(pred_tokens[i: i + n])] -= 1
score *= math.pow(num_matches / (len_pred - n + 1), math.pow(0.5, n))
return score
最后,利用训练好的循环神经网络“编码器-解码器”模型, [将几个英语句子翻译成法语],并计算BLEU的最终结果。
In [15]:
engs = ['go .', "i lost .", 'he\'s calm .', 'i\'m home .']
fras = ['va !', 'j\'ai perdu .', 'il est calme .', 'je suis chez moi .']
for eng, fra in zip(engs, fras): # 输入源句(英语),和(法语)答案标签
translation, attention_weight_seq = predict_seq2seq(
net, eng, src_vocab, tgt_vocab, num_steps, device)
print(f'{eng} => {translation}, bleu {bleu(translation, fra, k=2):.3f}')
# 看结果,bleu = 0 说明没有翻译对;因为咱的数据集很小很小,用到的方法也是最原始的seq2seq
go . => va chercher au lit suis, bleu 0.000 i lost . => j'ai perdu ., bleu 1.000 he's calm . => il est bon vu ., bleu 0.548 i'm home . => je suis bon partie ., bleu 0.548
7. 小结
- 根据“编码器-解码器”架构的设计, 我们可以使用两个循环神经网络来设计一个序列到序列学习的模型。
- 在实现编码器和解码器时,我们可以使用多层 (GRU) 循环神经网络。
- 我们可以使用遮蔽来过滤不相关的计算,例如在计算损失时。
- 在“编码器-解码器”训练中,强制教学方法将原始输出序列(而非预测结果)输入解码器。
- BLEU是一种常用的评估方法,它通过测量预测序列和标签序列之间的𝑛元语法的匹配度来评估预测。
「智能机器人开发者大赛」官方平台,致力于为开发者和参赛选手提供赛事技术指导、行业标准解读及团队实战案例解析;聚焦智能机器人开发全栈技术闭环,助力开发者攻克技术瓶颈,促进软硬件集成、场景应用及商业化落地的深度研讨。 加入智能机器人开发者社区iRobot Developer,与全球极客并肩突破技术边界,定义机器人开发的未来范式!
更多推荐






所有评论(0)