您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度16期: 语言智能为何从RNN转向Transformer? - 发现报告

汽车行业深度报告:AI系列深度16期: 语言智能为何从RNN转向Transformer?

交运设备 2026-08-06 黄细里 东吴证券 亓qí
报告封面

AI系列深度16期:语言智能为何从RNN转向Transformer? 2026年08月06日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼语言智能从RNN走向Transformer的本质,是序列建模从“递归记忆”转向“全局注意力”,并由此打开并行训练、规模扩展和任务统一的空间。RNN通过隐藏状态沿时间步传递上下文,适合文本、语音等顺序数据,并在LSTM/GRU、Seq2Seq和Attention-RNN推动下,于2014—2016年达到机器翻译等任务的工程高峰;但其串行计算、长距离依赖衰减和固定向量瓶颈,决定了递归范式很难继续承载大模型时代的规模化路线。 ◼Transformer的关键变化,不在于设计更复杂的记忆单元,而在于以自注意力让序列中任意位置直接交互,使语言建模从受串行结构约束的算法问题,转变为可随算力和数据扩展的工程问题。其优势集中体现在训练可并行、长距离依赖建模更强、结构更易堆叠扩展、归纳偏置更弱并更能释放大规模数据价值;相应代价是长序列计算成本、位置编码和小数据条件下先验不足等问题,这也是循环类结构在部分效率场景仍会延续的原因。 相关研究 《AI系列深度15期:Transformer如何开启AI第二次爆发?》2026-08-06 ◼我们以论文与代表成果为锚,将语言Transformer演进归纳为七阶段、三大阶段:2017年自注意力替代递归,完成架构确立;2018—2020年,BERT、GPT、T5/BART推动预训练—微调、理解与生成任务统一以及规模律验证,语言模型从特征提取器转向任务执行器;2021年后,指令微调、RLHF、CoT、RAG、工具调用、o1和DeepSeek-R1等成果继续叠加,使主线从单纯扩大预训练规模,走向后训练优化与测试时计算。 《AI系列深度14期:深度学习如何开启AI第一次爆发?》2026-08-05 ◼Transformer出现后,语言领域的研究和产业范式同步改变:研究主线从为每个任务设计专用架构,转向预训练通用底座加下游适配,再转向以对话式通用模型响应多类任务;产业形态则因“互动性”能力发生质变。相较AI1.0时代CNN输出标签、检测框等感知性中间结果,语言模型可以直接通过自然语言与用户交互,形成反复使用的入口,ChatGPT由此成为AI第二次爆发的产品拐点。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.递归结构:用隐藏状态承载上下文.........................................................................................41.2.从简单循环网络到门控机制与序列到序列框架.....................................................................41.3.结构性局限.................................................................................................................................5 2. Transformer爆发之前,循环网络的应用上限................................................................................6 2.1.循环网络时代语言任务的主要成果.........................................................................................62.2.应用上限:工程高峰已至,规模化与任务统一受限.............................................................7 3. Transformer与循环网络的结构对比及其优点................................................................................7 3.1.两种架构的结构对比.................................................................................................................73.2. Transformer相对循环网络的主要优点.....................................................................................8 4. Transformer应用于语言任务的学术成果梳理及发展阶段总结....................................................9 4.1.发展阶段框架.............................................................................................................................94.2.里程碑成果与论文分类...........................................................................................................104.3.逐阶段梳理...............................................................................................................................114.4.技术演进时间轴.......................................................................................................................12 5.1.研究与产业范式的变化...........................................................................................................135.2. Transformer是作为核心本体还是作为组件...........................................................................13 图表目录 图1:循环神经网络的循环单元与按时间展开示意...........................................................................4图2:长短期记忆网络(LSTM)与门控循环单元(GRU)的门控结构示意...............................5图3:梯度消失与长距离依赖衰减示意...............................................................................................6图4:自注意力与循环结构的信息交互方式对比...............................................................................8图5:Transformer在语言任务中的技术演进时间轴(2014—2025)............................................13 表1:循环网络在主要语言任务上的代表方法...................................................................................7表2:Transformer与循环网络的多维对比..........................................................................................9表3:Transformer语言任务发展七阶段—三大阶段框架................................................................10表4:Transformer语言任务重要成果分类表....................................................................................11表5:Transformer在语言与视觉任务中的角色对比........................................................................14 1.复盘RNN:递归结构如何定义语言任务上限 1.1.递归结构:用隐藏状态承载上下文 循环神经网络(Recurrent Neural Network,RNN)是一类专门处理序列数据的神经网络,典型场景包括文本、语音和时间序列。其核心在于引入“循环”结构:模型处理当前位置时,不仅接收当前输入,也会继承上一时刻形成的隐藏状态,并在此基础上更新当前状态。换言之,RNN通过同一套参数在序列各位置反复运算,把历史信息压缩进隐藏状态中,再沿时间维度逐步传递。该设计使模型能够用固定规模的参数处理不同长度的序列,并在一定程度上保存上下文信息。将这一递归过程沿时间展开,RNN可理解为一个深度随序列长度增加、但各层共享参数的前馈网络。 与同期卷积神经网络相比,RNN的优势来自对“顺序”的强假设。它默认数据不是一组彼此独立的点,而是像句子一样前后相连:前一个词会影响后一个词,同一套理解规则也可以在不同位置重复使用。因此,在文本、语音等天然有顺序的数据上,RNN与任务形态更匹配。 数据来源:《Finding Structure in Time》,《Backpropagation Through Time: What It Does and How toDo It》等其他文献,东吴证券研究所绘制 1.2.从简单循环网络到门控机制与序列到序列框架 RNN的思想可追溯至1980年代。Jordan(1986)与Elman(1990)先后提出带反馈连接的网络结构,奠定了“用隐藏状态承载上下文”的基本范式;Werbos(1990)系统化了沿时间反向传播训练算法。其后,Bengio等(1994)从理论上指出,简单RNN在信息跨多个时间步传递时容易出现梯度消失或梯度爆炸,导致模型很难记住较早位置的信息。针对这一问题,Hochreiter与Schmidhuber(1997)提出长短期记忆网络(LSTM),通过输入门、遗忘门、输出门与单元状态,控制信息“写入、保留、读出”;Cho等(2014)提出结构更简的门控循环单元(GRU)。门控机制相当于为模型增加一套记忆开关,显 著缓解了长程依赖问题,也使RNN在2010年代成为序