大模型的演变历史可以大致分为以下几个关键阶段,每个阶段都有其独特的技术突破和代表性模型:
-
史前时代与理论基础(2017年之前)
- 核心:技术储备,特别是Transformer架构的出现,为后续大模型的发展奠定了至关重要的理论基础 【1】 【2】 。
- 这个阶段也可以看作是萌芽期,为后续的爆发积累了关键技术 【12】 【14】 。
-
预训练-微调范式的确立与“大”模型的诞生(2018-2020)
- 核心突破:研究者们确立了“预训练-微调”范式,即先用海量数据训练一个庞大的基础模型,然后再用特定领域的数据进行微调,效果显著 【1】 【2】 。
- 开创者:GPT-1 (OpenAI, 2018) 和 BERT (Google, 2018) 是这一范式的标志性模型 【1】 【2】 。
- 趋势:模型参数开始急剧膨胀,进入“规模的竞赛” 【1】 【2】 。
- 2020年,OpenAI推出的GPT-3标志着从小模型正式向大模型转变,其特点是“大规模数据集无监督预训练 + 有监督微调”以及服务多任务的能力 【3】 。
-
从“理解”到“生成与对话”,AI走向普及(2021-2022)
- 核心突破:重点是让大模型变得更有用、更易用、更安全。关键技术包括指令微调(让模型学会遵循人类指令)和人类反馈强化学习(RLHF)(使模型输出更符合人类价值观和偏好) 【1】 【2】 。
- 关键里程碑:InstructGPT 和 ChatGPT(2022年)的出现,使得AI的交互性和实用性大大增强,推动了AI的普及 【1】 【2】 。
-
规模化、多模态化与生态竞争(2023年至今)
- 特点:ChatGPT之后,行业进入百花齐放、激烈竞争的阶段 【1】 【2】 。
- 技术趋势:
- 多模态:模型不再局限于文本,能同时理解图像、音频、视频等,如GPT-4V、Gemini 【1】 【2】 。
- 智能体:大模型作为“大脑”,可以调用工具(搜索引擎、计算器、API)、进行规划、执行复杂任务 【1】 【2】 。
- 缩放定律的继续探索:模型参数仍在增长,但更注重高效方法(如混合专家模型MoE) 【1】 【2】 。
- 垂直化与小型化:出现针对特定领域(医疗、法律、编程)优化的模型,以及可在边缘设备运行的轻量级模型 【1】 【2】 。
- 此阶段也被认为是爆发期 【12】 【14】 。
总结来看,大模型的演变核心脉络是从早期的理论探索和技术储备,到预训练-微调范式的建立,再到通过指令微调与RLHF提升实用性和安全性,最终进入当前多模态、规模化应用和激烈生态竞争的阶段。Transformer架构的出现和Scaling law(缩放定律)的探索贯穿了这一始终 【11】 。