- 1
- 0
- 约2.35千字
- 约 17页
- 2026-08-21 发布于山东
- 举报
1基于Transformer的中-英机器翻译
2宏观视角BERT取得成功的一个关键因素是Transformer的强大作用。Transformer由论文《AttentionisAllYouNeed》提出。Transformer改进了RNN最被人诟病的训练慢的缺点,利用self-attention机制实现快速并行。首先将Transformer看成是一个黑箱操作。在机器翻译中,就是输入一种语言,输出另一种语言。
3编码器-解码器结构拆开这个黑箱,可以看到它是由编码组件、解码组件和它们之间的连接组成。编码组件部分由一堆编码器(encoder)构成(论文中是将6个编码器叠在一起——数字6没有什么神奇之处,你也可以尝试其他数字)。解码组件部分也是由相同数量(与编码器对应)的解码器(decoder)组成的。
4编码器所有的编码器在结构上都是相同的,但它们没有共享参数。每个编码器都可以分解成两个子层。从编码器输入的句子首先会经过一个自注意力(self-attention)层,在对每个单词编码时关注输入句子的其他单词自注意力层的输出会传递到前馈(feed-forward)神经网络中,每个位置的单词对应的前馈神经网络都完全一样
5解码器解码器中也有编码器的自注意力(self-attention)层和前馈(feed-forward)层。除此之外,这两个层之间还有一个注
您可能关注的文档
- 【自然语言处理实践01】基于统计的文本表示.pptx
- 【自然语言处理实践02】基于Word2Vec的文本表示.pptx
- 【自然语言处理实践03】基于预训练的文本表示.pptx
- 【自然语言处理实践04】基于BiLSTM的文本分类.pptx
- 【自然语言处理实践05】基于Attention机制的文本分类.pptx
- 【自然语言处理实践06】基于预训练-微调的文本分类.pptx
- 【自然语言处理实践07】基于PaddleHub的低俗文本审核.pptx
- 【自然语言处理实践08】基于表示(Representation)的文本匹配.pptx
- 【自然语言处理实践09】基于交互(Interaction)的文本匹配.pptx
- 【自然语言处理实践10】基于预训练-微调的文本匹配.pptx
原创力文档

文档评论(0)