AI系列深度17期:视觉智能为何引入Transformer?.docxVIP

  • 0
  • 0
  • 约1.61万字
  • 约 26页
  • 2026-08-10 发布于湖南
  • 举报

AI系列深度17期:视觉智能为何引入Transformer?.docx

东吴证券研究所1/16

东吴证券研究所

请务必阅读正文之后的免责声明部分

请务必阅读正文之后的免责声明部分

证券研究报告

证券研究报告·行业深度报告·汽车

汽车行业深度报告

AI系列深度17期:视觉智能为何引入2026年08月06日

Transformer?

增持(维持)

投资要点

n视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。

nTransformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化

文档评论(0)

1亿VIP精品文档

相关文档