【计算机视觉实践09】基于Vision Transformer的CIFAR10分类.pptxVIP

  • 0
  • 0
  • 约小于1千字
  • 约 7页
  • 2026-08-21 发布于山东
  • 举报

【计算机视觉实践09】基于Vision Transformer的CIFAR10分类.pptx

1;可以看做一种通用的思想,指人们在工作时注意力往往会集中在整个场景中的某些焦点上

重要的部分更加注意,不重要的部分忽略

;Transformer简介

自Attention机制提出后,引入Attention的Seq2seq模型在各个任务上都有了提升

Google提出了解决Seq2Seq问题的Transformer模型,使用全Attention结构代替传统的RNN建模

机器翻译

关键点

全Attention结构

多头注意力机制:Multi-HeadAttention

逐位置前馈网络:Position-WiseFeed-ForwardNetworks;模型结构

Encoder:N层

多头注意力层(+残差连接+层归一化)

逐位置前馈网络(+残差连接+层归一化)

Decoder:N层

掩码多头注意力层(+残差连接+层归一化)

交叉多头注意力层(+残差连接+层归一化)

逐位置前馈网络(+残差连接+层归一化)

线性映射解码层;模型结构

Encoder:N层

多头注意力层(+残差连接+层归一化)

逐位置前馈网络(+残差连接+层归一化)

Decoder:N层

掩码多头注意力层(+残差连接+层归一化)

交叉多头注意力层(+残差连接+层归一化)

逐位置前馈网络(+残差连接+层归一化)

线性映射解码层;首先将图片进行分块,展开(或CNN进行特征映射),做线性变换(形成

文档评论(0)

1亿VIP精品文档

相关文档