Transformer架构详解:从RNN到Self-Attention机制.pdfVIP

  • 4
  • 0
  • 约2.61千字
  • 约 33页
  • 2026-04-21 发布于北京
  • 举报

Transformer架构详解:从RNN到Self-Attention机制.pdf

传统的RNN网络

计算时有什么问题?

传统的RNN网络

Self-Attention机制来进行并行计算,在输入和输出都相同

输出结果是同时被计算出来的,现在基本已经取代RNN了

传统的word2vec

表示向量时有什么问题?

如果‘干哈那’是一个词

不同语境中相同的词如何表达

预训练好的向量就永久不变了

整体架构

输入如何编码?

输出结果?

Attention的目的?

怎样组合在一起?

Attention是啥意思呢?

对于输入的数据,你的关注点?

如何才能让计算机关注到这些有价值的信息?

self-attention?

self-attention如何计算?

输入经过编码后得到向量

想得到当前

文档评论(0)

1亿VIP精品文档

相关文档