AI系 列 深 度17期:视 觉 智 能 为 何 引 入Transformer? 2026年08月06日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。 ◼Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。 相关研究 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet等重新吸收局部性、层级结构和多尺度先验,ConvNeXt则证明ViT训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3分别推动自监督通用特征、开放词表图文对齐和可提示分割。 《重卡全球化专题02:基建物流双轮驱动东南亚扩容,中国重卡出海进入收获期》2026-08-06 ◼从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过CLIP、GPT-4V、Florence-2等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.基本原理:三项视觉归纳偏置与层级特征抽象.....................................................................41.2.从LeNet到ResNet的演进.......................................................................................................41.3.结构性局限.................................................................................................................................5 2. Transformer爆发之前,卷积网络的应用上限................................................................................5 2.1.卷积网络时代视觉任务的主要成果.........................................................................................52.2.应用上限:封闭标签、任务专用与全局建模约束.................................................................6 3. Transformer与卷积网络的结构对比及其优点................................................................................6 3.1.两种架构的结构对比.................................................................................................................73.2. Transformer相对卷积网络的主要优点.....................................................................................7 4. Transformer应用于视觉任务的学术成果梳理及发展阶段总结....................................................8 4.1.发展阶段框架.............................................................................................................................94.2.里程碑学术成果与论文...........................................................................................................104.3.逐阶段梳理...............................................................................................................................104.4.技术演进时间轴.......................................................................................................................12 5.1. Transformer缺少CNN的视觉归纳偏置................................................................................135.2.是否所有视觉任务都已改用Transformer..............................................................................135.3. Transformer是作为核心本体还是作为组件...........................................................................14 6. Transformer在语言、图像任务发展的对比..................................................................................14 7.风险提示............................................................................................................................................15 图表目录 图1:卷积神经网络的三项视觉归纳偏置...........................................................................................4图2:卷积神经网络的典型层级结构与特征抽象...............................................................................4图3:卷积网络(CNN)与视觉Transformer(ViT)的结构对比...................................................7图4:Transformer在视觉任务中的技术演进时间轴(2017—2026)............................................12图5:视觉归纳偏置的强弱谱与补偿手段.........................................................................................13 表1:卷积网络在主要视觉任务上的代表方法...................................................................................6表2:Transformer与卷积网络的多维对比..........................................................................................8表3:Transformer视觉任务发展三大阶段—子阶段框架..................................................................9表4:Transformer视觉任务重要成果分类表(里程碑红色加粗)................................................10表5:Transformer在语言与视觉任务中的角色对比........................................................................14 1.复盘CNN:视觉归纳偏置如何定义视觉任务上限 1.1.基本原理:三项视觉归纳偏置与层级特征抽象 卷积神经网络(CNN)是一类专门处理图像等网格结构数据的神经网络。与全连接网络为每个像素单独赋权不同,CNN通过卷积核在图像上滑动,对局部区域做加权求和,从中提取边缘、纹理等基础特征;再通过池化对特征图下采样,扩大观察范围,并增强对轻微位移的鲁棒性。可以把卷积核理解为一组会移动的“滤镜”:浅层滤镜先识别边缘和纹理,深层网络再把这些局部线索组合成部件和语义,最终由全连接层或检测/分割头输出结果。 CNN之所以高度契合图像,源于其架构内置的三项视觉归纳偏置。 其一,局部连接:每个神经元只看输入的局部邻域,对应“基础视觉模式通常出现在局部”的先验。 其二,权重共享:同一个卷积核在整张图像上重复使用,对应“同一种局部模式可出现在不同位置”的先验,并大幅减少参数量。 其三,平移等变性:在理想卷积条件下,输入图像发生平移,输出特征图也随之平移。 我们认为,正是这些由架构直接注入、而非完全依靠数据学习得