- 4
- 0
- 约2.61千字
- 约 33页
- 2026-04-21 发布于北京
- 举报
传统的RNN网络
计算时有什么问题?
传统的RNN网络
Self-Attention机制来进行并行计算,在输入和输出都相同
输出结果是同时被计算出来的,现在基本已经取代RNN了
传统的word2vec
表示向量时有什么问题?
如果‘干哈那’是一个词
不同语境中相同的词如何表达
预训练好的向量就永久不变了
整体架构
输入如何编码?
输出结果?
Attention的目的?
怎样组合在一起?
Attention是啥意思呢?
对于输入的数据,你的关注点?
如何才能让计算机关注到这些有价值的信息?
self-attention?
self-attention如何计算?
输入经过编码后得到向量
想得到当前
原创力文档

文档评论(0)