这份研报深入探讨了视觉智能引入Transformer的必要性和发展路径。报告指出,视觉Transformer化并非简单替代CNN,而是图像token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。报告对比了CNN和Transformer在视觉任务中的优劣势,分析了CNN在局部建模和任务专用性上的优势,以及Transformer在全局建模和跨任务应用上的长处。同时,报告也揭示了Transformer在缺乏视觉归纳偏置、计算开销大等方面的代价。此外,报告还梳理了视觉Transformer化的三个发展阶段,从早期的图像token化到可扩展通用骨干,再到如今的视觉基础模型,展示了技术演进的趋势。最后,报告强调了视觉与语言在智能发展上的差异,以及视觉Transformer化在视觉领域更多扮演骨干网络角色的特点。
视觉智能行业未来发展趋势呈现多维度演进。首先,视觉Transformer化将逐步深化,更多表现为与CNN等传统方法的融合与再平衡,而非彻底替代。Transformer将在视觉领域更多扮演骨干网络角色,被嵌入检测、分割与多模态等更大处理流程中。其次,视觉基础模型将成为重要方向,推动自监督通用特征学习、开放词表图文对齐和可提示分割等技术发展。此外,视觉智能将加速与语言、多模态技术的融合,实现更强大的跨任务和跨模态能力。最后,智能驾驶和机器人领域将是视觉智能技术商业化的重要落地方向,但需关注技术迭代、大模型厂商ARR增速、云服务商资本开支以及商业化落地等多重风险。
研报重点分析了视觉Transformer化的本质、CNN与Transformer的优劣对比、视觉Transformer化的三个发展阶段,以及视觉与语言的智能发展对比。在本质方面,报告强调视觉Transformer化是图像token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。在CNN与Transformer对比中,报告指出CNN在局部建模和任务专用性上有优势,而Transformer在全局建模和跨任务应用上更优。在发展阶段方面,报告梳理了从图像token化到可扩展通用骨干,再到视觉基础模型的演进路径。最后,报告对比了视觉与语言在智能发展上的差异,指出视觉智能已完成架构与规模两次跃迁,但对齐和推理跃迁仍需进一步发展。
当前视觉智能市场处于技术快速迭代和商业化加速的阶段。视觉Transformer化已从早期探索进入融合与再平衡的新阶段,Transformer不再仅仅是替代CNN,而是作为骨干网络嵌入更复杂的视觉处理流程中。视觉基础模型如DINOv2/DINOv3、CLIP、SAM等已展现出强大的特征学习和多模态对齐能力,推动视觉智能向更高阶发展。同时,智能驾驶和机器人领域成为商业化落地的重要方向,但面临技术迭代、大模型厂商ARR增速、云服务商资本开支以及商业化落地等多重挑战。整体来看,视觉智能市场充满活力,但也需关注潜在风险。
研报提示了视觉智能领域面临的多重风险。首先,技术迭代不及预期的风险,视觉智能技术发展迅速,但新技术的实际效果和落地应用可能存在不确定性。其次,大模型厂商ARR增速放缓的风险,随着市场竞争加剧,大模型厂商的营收增长可能面临压力。第三,云服务商资本开支不及预期的风险,云服务商为支持视觉智能发展需要持续投入,但资本开支可能受宏观经济环境影响。最后,智能驾驶及机器人商业化落地不及预期的风险,尽管市场需求旺盛,但技术成熟度和商业模式仍需进一步验证。这些风险需引起投资者关注。