您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度15期:Transformer如何开启AI第二次爆发? - 发现报告

汽车行业深度报告:AI系列深度15期:Transformer如何开启AI第二次爆发?

交运设备 2026-08-05 黄细里 东吴证券 杨框子
报告封面

AI系列深度15期:Transformer如何开启AI第二次爆发? 2026年08月05日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼AI第二次爆发的本质,是模型能力形成方式从“人工设计”转向“规模化学习”。AI1.0时代深度学习仍带有“一任务一模型”特征,CNN、RNN等架构分别服务于图像、文本等专用任务,能力主要停留在基础感知层面。本轮AI2.0以Transformer等通用底座为核心,叠加数据、算力与自监督训练,使模型学习统计结构与通用表征,能力来源由强任务先验和强归纳偏置,转向弱归纳偏置下的规模化学习与涌现。 ◼Transformer成为AI2.0关键基础架构:自注意力机制解决循环网络串行计算和长程依赖瓶颈,更适合GPU并行算力与大规模训练;弱归纳偏置为跨模态迁移提供统一接口,使多类输入逐步进入同一底座体系。2017年以来,主干架构总体稳定,能力提升更多来自MoE、长上下文、多模态融合、后训练与推理机制,而非底层架构切换。 相关研究 《AI系列深度14期:深度学习如何开启AI第一次爆发?》2026-08-05 ◼从技术演进看,大模型可概括为“模型能力奠基—人机对齐与行为优化—推理与外部系统赋能”三阶段,并由能力广度和使用效率两条支线贯穿。第一阶段通过预训练、规模扩张和Scaling Laws奠定参数内能力;第二阶段通过SFT、RLHF、DPO等对齐技术提升可用性;第三阶段依托思维链、RAG、工具调用、强化学习推理和任务路由,将能力增量迁移到运行时系统。 《AI系列深度13期:世界模型如何实现?》2026-08-05 ◼GPT系列提供了大语言模型落地产业端的典型路径:GPT-1至GPT-3验证decoder-only架构和规模化泛化能力,InstructGPT与ChatGPT补齐 交 互 入 口 ,GPT-4/GPT-4o推 动 模 型 走 向 多 模 态 交 互 ,o1/o3/o4-mini/GPT-5进一步整合推理时计算、工具使用、多模态任务和实时路由。关键技术通常先在研究与工程验证中形成,再通过产品化入口实现规模扩散。 ◼Scaling Law回答“规模如何转化为能力”,也反映AI2.0资源优化边界的外扩。早期scaling围绕参数量、数据量与训练算力展开,随后纳入能力涌现、计算最优配比、高质量数据、对齐、部署和推理成本等约束。2024年以来,MoE稀疏激活、测试时计算、RL reasoning、扩散Transformer与视频生成等方向,使scaling扩展为训练、推理、数据、架构、对齐与多模态的全链条资源优化框架。 ◼从产业形态看,AI第二次爆发的外在结果是数字AI任务边界初步收敛。Transformer已参与文本、代码、知识库、工具、多模态输入和数字工作流,推动架构、任务与模态三重收敛。产业价值重心也从“设计何种架构”,转向“谁能把规模、数据、对齐、推理与系统工程能力做到位”。但推理阶段增量目前更多体现在语言、数学、代码等可验证任务中,向视觉生成、复杂多模态交互与真实物理闭环迁移仍需验证。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1. AI2.0的本质:从“人工设计”到“规模化学习”.................................................................................42. Transformer成为跨模态通用底座.....................................................................................................43. Transformer发展复盘.........................................................................................................................53.1.阶段一:模型能力奠基.............................................................................................................63.2.阶段二:人机对齐、行为优化.................................................................................................63.3.阶段三:推理与外部系统赋能.................................................................................................73.4.模型能力的广度与效率.............................................................................................................74.复盘GPT:大语言模型如何落地产业端.........................................................................................75. Scaling Law复盘:从预训练幂律到全链条资源优化...................................................................116.大语言模型或已成为数字AI任务的通解......................................................................................137.结论....................................................................................................................................................138.风险提示............................................................................................................................................14 图表目录 图1:Transformer结构示意..................................................................................................................5图2:Transformer时代重要论文/成果发展时间轴.............................................................................6图3:GPT2018—2026发展历程..........................................................................................................8图4:GPT-1至GPT-3模型对比..........................................................................................................8图5:RLHF(基于人类反馈的强化学习)三阶段............................................................................8图6:GPT-3.5/ChatGPT正式进入产品化阶段....................................................................................9图7:GPT-4支持多模态任务,可处理图片类信息输入.................................................................10图8:o1在推理密集型任务中的表现显著优于GPT-4o..................................................................10图9:GPT-5的统一系统与推理路由机制.........................................................................................10图10:扩展规律——损失随算力/参数/数据的幂律下降................................................................12图11:代表性模型规模演进(参数量vs训练数据量).................................................................12图12:Transformer带来的模型三重收敛(专用模型→通用基础模型)......................................13 表1:主流架构的归纳偏置...................................................................................................................4表2:扩展规律(scaling law)的六阶段演进..................................................................................12 1.AI2.0的本质:从“人工设计”到“规模化学习” 2012年AlexNet在ImageNet数据集上取得突破,正式开启深度学习第一轮发展浪潮。该阶段具有鲜明的“一任务一模型”特征:CNN、RNN等网络架构各自适配特定任务领域,模型核心价值主要集中在图像、文本等基础感知环节。受架构能力约束,当时模型尚难形成流畅的人机交互能力,这也是To C产品未能大规模落地的重要原因。 AI第二轮产业变革的核心逻辑出现根本变化:模型能力不再主要依靠人工定制,而是依托海量数据与规模化训练自主形成。上一轮深度学习的模型性能高度依赖人为设计的网络结构,研发人员依据图像局部特征、时序依赖等现实规律设计架构。本轮大模型以Transformer等统一通用架构为基础,叠加算力提升与数据规模扩张,通过自监督训练从海量样本中学习统计结构与通用表征,使模型能力形成方式由过去依赖强任务先验和强归纳偏置,转向弱归纳偏置下的规模化学习与能力涌现。 各类主流网络架构的归纳偏置强度整体呈递减趋势:CNN绑定较强的空间特征约束,RNN内置时序递归逻辑,而Transformer主要依