AI系列深度07期:CNN与ViT两类视觉骨干有何差异? 2026年07月30日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。 ◼视觉架构大体经历四个阶段:手工特征时代依赖SIFT、HOG等专家设计;CNN崛起后,AlexNet、VGG、ResNet推动机器自动学习视觉特征;ViT通过把图像切成patch并当作token输入Transformer,使注意力机制进入视觉;2021年后,Swin、CoAtNet、ConvNeXt等推动CNN与ViT相互吸收,进入融合时代。 相关研究 ◼CNN的优势来自三项视觉归纳偏置:局部连接、权值共享和平移等变性。这些结构假设使模型在数据有限时更高效,也更适合端侧和实时部署;约束在于局部感受野逐层扩大,长程依赖建模较弱。ViT以自注意力实现第一层全局交互,弱先验、强规模化,在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强。 《AI系列深度06期:Transformer如何从序列任务走向基座模型?》2026-07-30 《具身智能系列01:本体厂商资本化加速,通用机器人产业链进入验证期》2026-07-29 ◼核心争议在于ViT是否真正“强于”CNN,还是更多受益于更大数据和现代训练范式。ConvNeXt证明纯卷积配合现代训练技巧仍可追平部分ViT,MLP-Mixer也提示注意力未必是唯一变量;因此更准确的理解是,视觉架构正在从“强先验”与“弱先验”两端走向任务、数据、算力约束下的动态平衡。 ◼产业落地呈现分层:多模态大模型和研究前沿普遍采用ViT或类Transformer视觉编码器,CLIP、SigLIP、Qwen-VL等均沿此方向推进;自动驾驶量产系统则受车端算力、时延和安全约束影响,更多采用CNN前端、BEV/Transformer融合和混合骨干。研究前沿偏ViT,车端量产偏混合,是当前现实分工。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 2.1.手工特征时代:依赖专家设计视觉描述子.............................................................................42.2. CNN崛起:深度网络自动学习视觉特征................................................................................42.3. ViT登场:注意力机制进入视觉..............................................................................................5 3. CNN机制:卷积为何适合图像..........................................................................................................5 3.1.核心机制:卷积、池化与任务头.............................................................................................53.2.三项设计先验:局部连接、权值共享、平移等变性.............................................................6 4.1.前置概念:Self-Attention机制.................................................................................................64.2.核心设计:patch切分、token化与Transformer编码...........................................................6 5. CNN与ViT:先验、数据与部署的四组分歧..................................................................................7 5.1.感受野:逐层扩大与首层全局交互.........................................................................................75.2.归纳偏置:强先验与数据驱动.................................................................................................75.3.数据效率与规模化特性.............................................................................................................75.4.计算复杂度与部署场景.............................................................................................................8 6.核心争议:架构优势与约束边界......................................................................................................8 6.1. ViT更强,还是数据和训练范式贡献更大..............................................................................86.2.归纳偏置:资产还是约束.........................................................................................................9 7.风险提示..............................................................................................................................................9 图表目录 表1:视觉架构演进的四个时代...........................................................................................................5表2:CNN与ViT四组路线分歧对照.................................................................................................8 1.视觉骨干网络:机器视觉的表征底座 视觉任务的核心,是将原始像素编码为可被分类、检测、分割等任务调用的高层语义特征。视觉骨干网络承担这一编码过程,是机器视觉系统的表征底座。CNN与ViT是获得视觉表征的两类架构路径。CNN将局部性、权值共享和平移等变性等视觉先验写入结构;ViT通过自注意力将图像表示为token序列,并依赖数据规模学习空间关系。 视觉骨干网络是计算机视觉系统中将原始像素转化为高层语义特征的核心模块。图像在计算机中首先表现为像素矩阵,模型需要将低层数值信号转化为可表达物体、边界、位置和语义关系的特征,再交由分类、检测或分割任务头使用。因此,骨干网络的表征质量直接决定下游任务上限。 图像识别的根本难点在于语义鸿沟:低层像素变化与高层语义含义之间并不一一对应。同一对象在视角、光照、遮挡、尺度变化下像素差异可能很大,而不同类别对象在局部纹理上又可能相似。视觉模型既需要对平移、缩放、形变和光照变化保持稳定,又需要保留区分类别和实例的关键差异。 计算机视觉主流任务可分为图像分类、目标检测、语义分割与实例分割等层次,难度依次提升。它们通常共享“骨干网络+任务头”的范式:骨干网络负责提取通用视觉特征,任务头负责输出类别、位置或像素级预测。因此,CNN与ViT之争本质上影响的是视觉系统的通用表征底座,而不只是单一任务模型选择。 2.视觉架构演进:从手工特征到融合骨干 2.1.手工特征时代:依赖专家设计视觉描述子 在深度学习兴起前,图像特征主要依赖人工设计的算子。SIFT通过关键点描述子提升对尺度和旋转变化的稳定性,HOG通过方向梯度直方图刻画局部形状并常用于行人检测,再配合SVM等浅层分类器完成识别。2010—2011年ImageNet大规模视觉识别挑战赛获胜方案多属于这一类。 手工特征的主要约束在于依赖专家经验、跨任务迁移能力弱、难以随数据规模扩展。在特定场景中调优后的特征,换到新类别、新光照或新背景下往往需要重新设计。随着ImageNet等大规模数据集出现,人工特征的表达上限迅速暴露,深度网络自动学习特征成为视觉架构演进的核心方向。 2.2.CNN崛起:深度网络自动学习视觉特征 AlexNet是CNN成为视觉主流架构的关键转折。2012年,Krizhevsky、Sutskever与Hinton提出的AlexNet在ImageNet上将Top-5错误率显著降低,核心变化在于特征不再由人工设计,而由深度卷积网络从海量图像中自动学习。此后,CNN成为分类、检测、 分割等任务的主流视觉骨干。 2014—2020年,CNN沿深度、宽度和结构效率持续演进。VGG通过连续3×3小卷积堆叠提升深度,GoogLeNet/Inception通过多尺度并行模块提升效率,ResNet通过残差连接缓解深层网络训练困难,将网络深度推向百层以上。该阶段CNN在自动驾驶、安防、医疗影像等视觉应用中广泛落地,形成视觉骨干的产业基础。 2.3.ViT登场:注意力机制进入视觉 ViT将Transformer引入视觉任务。2020年,Dosovitskiy等提出Vision Transformer,将图像切分为固定大小patch,并将patch投影为token序列,再输入标准Transformer编码器。在谷歌内部JFT-300M大规模数据集上预训练后,ViT分类精度超过当时强CNN模型,验证了弱视觉先验、强数据规模路径的可行性。 ViT成功的关键前提是数据规模。若仅在ImageNet-1k等中等规模数据集上从头训练,ViT通常不优于同级别CNN;在ImageNet-21k、JFT-300M等更大规模数据上预训练后,其优势才逐步显现。由此可见,ViT的核心特征是在大数据和大模型预训练下具备更高可扩展性。 3.CNN机制:卷积为何适合图像 3.1.核心机制:卷积、池化与任务头 卷积