-
RNN的回顾与局限
循环神经网络(RNN)通过隐藏状态传递上下文信息,适合处理文本、语音等序列数据。其演进路径包括反馈网络、BPTT训练算法、LSTM/GRU门控机制、Seq2Seq框架和注意力机制,在2014-2016年达到机器翻译等任务的工程高峰。但RNN存在串行计算、长距离依赖衰减和固定向量瓶颈等结构性局限,限制了规模化和任务统一。
-
Transformer的突破与优势
Transformer通过自注意力机制使序列中任意位置直接交互,突破递归范式,实现并行训练、更强长距离依赖建模、更高可扩展性和更弱归纳偏置。其代价包括长序列计算成本高、需位置编码和小数据条件下先验不足,但在效率场景中循环类结构仍占优势。
-
Transformer的发展阶段
- 架构确立(2017):Attention Is All You Need以自注意力替代递归,确立Transformer架构。
- 范式统一与规模化(2018-2020):预训练+微调成为主流,BERT/GPT推动理解与生成任务统一,规模扩展实现少样本能力。
- 对齐与推理(2021-2025):指令微调(InstructGPT/RLHF)、思维链(CoT)、工具调用(Toolformer)和推理模型(o1)等成果提升模型可用性和推理能力。
-
研究与产业范式变化
研究从专用架构转向预训练通用底座+下游适配,最终发展为对话式通用模型。产业形态从“感知性”中间能力(如CNN)转变为“互动性”能力(如ChatGPT),语言模型成为AI第二次爆发的核心入口。
-
Transformer的角色
在语言任务中,Transformer以“核心本体”直接运用,与视觉领域(多为组件)形成对比,体现语言数据与任务形式的契合性。
-
风险提示
技术迭代不及预期、大模型厂商ARR增速放缓、云服务商资本开支不及预期、智能驾驶及机器人商业化落地不及预期。