AI系列深度07期:CNN与ViT两类视觉骨干有何差异?.pptxVIP

  • 2
  • 0
  • 约8.18千字
  • 约 10页
  • 2026-08-04 发布于湖南
  • 举报

AI系列深度07期:CNN与ViT两类视觉骨干有何差异?.pptx

增持(维持)

投资要点

n视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。

n视觉架构大体经历四个阶段:手工特征时代依赖SIFT、HOG等专家设计;CNN崛起后,AlexNet、VGG、ResNet推动机器自动学习视觉特征;ViT通过把图像切成patch并当作token输入Transformer,使注意力机制进入视觉;20

文档评论(0)

1亿VIP精品文档

相关文档