AI系列深度06期:Transformer如何从序列任务走向基座模型? 2026年07月30日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼RNN与Transformer是序列建模的两代核心架构,解决文字、语音、视频和轨迹等有先后顺序的数据如何形成表征的问题。序列建模的难点在于变长、有序和长程依赖:模型既要保留上下文,又要把相距较远的相关信息联系起来。 ◼RNN的基本思路是把历史压缩进一个随时间更新的隐藏状态。该结构推理成本相对恒定,适合早期机器翻译、语音识别和时间序列任务;LSTM、GRU通过门控机制缓解长程遗忘,Seq2Seq和注意力机制进一步推动模型更迭。但RNN必须逐步串行处理,难以充分利用并行算力,长距离信息也容易在压缩状态中衰减。 ◼Transformer采取不同路径:不再把历史压缩成单一状态,而是用自注意力让每个位置直接与所有位置交互。多头注意力、位置编码和前馈层共同构成其结构基础,使训练可以并行、长程依赖路径显著缩短,并为模型规模化扩展提供架构基础。GPT、BERT以及后续LLM、VLM、VLA大多以Transformer为核心底座,反映其在云端通用基础模型中的主导地位。 相关研究 《AI系列深度05期:模型如何学习表征并实现对齐?》2026-07-29 《AI系列深度04期:什么是表征?》2026-07-29 ◼两者分歧可归纳为记忆、计算和长程建模三组权衡:RNN以定长状态换取相对恒定的推理成本,但训练串行、记忆容量受限;Transformer全量缓存历史,训练并行、长程建模更强,但注意力计算随序列长度平方增长,超长上下文推理成本较高。该约束也是Mamba、RWKV、线性注意力和混合架构重新受到关注的重要原因。 ◼Transformer替代传统RNN主干,并不意味着循环思想消失。2023年以来,状态空间模型、选择性状态更新和线性注意力在长上下文、端侧低功耗、低时延场景中体现价值;同时,存在混合架构的技术路径,用少数注意力层保留精确回忆能力,用多数高效层降低计算成本。整体看,Transformer仍是通用基础模型主线,新循环更像特定约束下的重要补充。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1. RNN与Transformer:序列建模的两代答案...................................................................................32.共同问题:序列如何保留上下文......................................................................................................32.1.序列数据的本质:变长、有序、长程依赖.............................................................................32.2.两类核心机制:状态压缩与全量检索.....................................................................................43. RNN机制:把历史压缩为隐藏状态..................................................................................................43.1.核心机制:循环、隐状态与时间展开.....................................................................................43.2.门控的引入:LSTM与GRU如何缓解长程遗忘..................................................................43.3.固有约束:串行、难并行与长程上限.....................................................................................54. Transformer机制:基于自注意力实现全局交互............................................................................54.1.自注意力与QKV:全局检索的基础.......................................................................................54.2.核心设计:多头注意力、位置编码与前馈层.........................................................................64.3.规模化能力与计算代价.............................................................................................................65.路线分歧:记忆、计算与新循环回潮..............................................................................................65.1.三组关键分歧.............................................................................................................................65.2.循环思想以新形态融入模型.....................................................................................................75.3.结语:以记忆与计算权衡理解序列智能.................................................................................76.风险提示..............................................................................................................................................8 1.RNN与Transformer:序列建模的两代答案 RNN与Transformer是序列建模从状态压缩走向全局交互的两代核心架构。CNN/ViT主要解决图像表征问题,RNN与Transformer则面向文字、语音、视频、车辆轨迹等有顺序的数据,核心难点在于上下文保留和长程依赖建模。我们认为,Transformer已在云端通用基础模型中显著替代传统RNN主干,并成为GPT、BERT以及多数LLM、VLM、VLA的核心底座;原因在于RNN依赖逐步递推和状态压缩,训练难以并行,长程信息容易衰减,而Transformer通过自注意力实现全局交互和高并行训练,能够承接更大规模数据与算力。但循环、状态压缩与递推记忆并未消失,正在长上下文、端侧和低时延场景中以新形式回归。 当下大模型、智能体与具身智能的能力基础,均离不开序列建模网络。理解人工智能为何在2017年后加速演进,需要比较循环神经网络与Transformer两类架构的替代关系。 Transformer是当今云端通用基础模型的核心底座。生成式预训练模型,名称中的“T”即Transformer;从大语言模型(LLM)到视觉语言模型(VLM),再到机器人领域的视觉语言动作模型(VLA),主流云端基础模型多以Transformer为核心骨架。但在车端、端侧和低时延系统中,混合架构、状态空间模型或压缩机制仍具备应用空间。厘清Transformer,有助于理解序列模型为何能够高效并行训练,并将模型和数据规模推向新的量级。 传统RNN主干已被显著替代,但对照RNN才能看清本轮跃迁。RNN是2010年代序列建模的主力,机器翻译、语音识别和早期对话系统多以其为核心。Transformer相对RNN的关键变化,是从逐步压缩历史转向全局交互与并行训练。 但注意力机制的计算成本随序列长度呈平方增长,在超长上下文与端侧推理场景中代价高昂。2023年以来,以状态空间模型Mamba、RWKV和线性注意力为代表的新循环路线重新活跃,循环思想以新的形态回归。 2.共同问题:序列如何保留上下文 RNN与Transformer的结构差异较大,但二者回答的是同一问题:模型如何处理一段有先后顺序、长度可变且前后相互依赖的数据。理解这一共同问题,是理解两类架构分歧的前提。 2.1.序列数据的本质:变长、有序、长程依赖 序列建模指对按顺序排列且长度不固定的元素进行建模,用于预测、生成或理解整段内容。文本、语音、视频和车辆轨迹均属于序列数据,其共同特征是存在明确先后关 系,且前后元素相互影响。 顺序携带信息:序列的顺序本身即为信息。“狗咬人”与“人咬狗”用词相同、顺序不同,含义截然相反。模型必须对位置与先后敏感,而不能把输入当作无序集合。 长程依赖是核心难点:序列建模最难的地方在于长程依赖:决定当前输出的关键信息可能出现在很久以前。例如“小张昨天把那本从图书馆借来的、封面已经磨损的书还了,它……”中的“它”指代哪本书,须回看一长串修饰之前的名词。模型能否跨越很长的间隔把相关信息联系起来,直接决定其能力上限。 可用的序列模型还需满足两类工程诉求:训练阶段能否并行,决定其是否能够在大规模数据上高效训练;推理阶段成本是否可控,决定其能否低成本部署并处理长输入。即长程记忆、训练并行和推理成本之间存在权衡。 2.2.两类核心机制:状态压缩与全量检索 RNN路线将历史压缩为定长状态。模型在每个时间步将当前输入与上一时间步的隐藏状态共同更新为新的隐藏状态,用该状态概括截至当前的历史信息。该设计的优势是无论序列多长,状态维度保持不变;约束也来自这一点,历史信息越多,早期细节越可能在连续压缩中衰减。 Transformer路线保留历史并按需检索。模型不把全部历史压缩为单一状态,而是保留各位置表示,并通过注意力机制让当前位置与历史位置直接交互。该方式降低了长程依赖路径长度,提升了信息保留能力,但也需要存储和计算更长的上下文。 3.RNN机制:把历史压缩为隐藏状态 循环神经网络是序列建模AI1.0时代的主流架构。其核心思路是用一个随时间不断更新的状态概括历史。 3.1.核心机制:循环、隐状态与时间展开 循环与隐状态构成RNN的基本机制。RNN按时间顺序处理序列元素,每一步将当前输入与上一隐藏状态输入同一组网络,得到新的隐藏状态和输出。隐藏状态承担历史信息载体的角色,通过逐步更新把上下文传递到后续时间步。 时间展开与参数共享是RNN适配变长序列的基础。将循环沿时间轴展开后,RNN等价于一条按时间连接的深层网络,每个时间步使用同一组参数。参数共享使其能够处理不同长