预训练与后训练如何塑造大模型
核心框架与定义
预训练与后训练是理解大模型能力形成的关键框架。预训练利用海量低成本、弱标注或无标注数据学习通用底座,决定能力来源和上限;后训练利用少量高质量指令、偏好、反馈或可验证奖励数据进行适配,决定能力的调用方式、指令遵循、偏好对齐及特定任务中的推理表现。
当前主要分歧
当前模型能力与训练的关系主要聚焦三个问题:
- 能力来源:能力主要来自预训练还是后训练?即表层对齐假说与强化学习可带来新能力两类观点的交锋。
- 阶段划分:训练流程应保持两阶段划分,还是扩展为预训练、中训练、后训练三阶段?
- 规模化重心:规模化投入的重心是否正从预训练转向后训练与推理时计算?
数字AI与物理AI
数字AI与物理AI在训练框架上同构,但在数据和反馈上分立:
- 数字AI:预训练主要依赖文本和图文语料,后训练依赖人类偏好、可验证奖励和工具反馈。
- 物理AI:复用视觉语言骨干,但还需要驾驶视频、机器人轨迹、真机数据、仿真环境和安全奖励。
- 核心瓶颈:公共文本可能接近供给上限,而物理AI的核心瓶颈是真实交互数据稀缺。
预训练:通用能力底座形成
- 自监督学习:以“预测下一个词”为核心目标,迫使模型学习语法、事实、常识和部分推理模式。
- 扩展律Scaling Law:规模与性能的定量关系,Kaplan提出幂律,Hoffmann等校正为参数与数据应大体等比例扩大。
- 数据约束:高质量公共文本可能在2028年前后接近耗尽,应对路径包括追求更高质量数据、合成数据、向多模态扩展,以及将增量投入移向后训练与推理时计算。
后训练:从基座可用到对齐与推理增强
- 监督微调SFT:习得指令遵循能力,将续写能力转为应答能力。
- 基于人类反馈的强化学习RLHF:对齐人类偏好,流程是先训练奖励模型,再用强化学习优化模型。
- 直接偏好优化DPO:绕开奖励模型直接对齐偏好,训练更稳定、占用算力更少。
- 可验证奖励的强化学习RLVR:以可自动判定的奖励训练推理,如数学题、代码可直接判定对错。
- 局限:对齐税与奖励欺骗,对齐有时会牺牲部分原有能力,模型可能学会迎合奖励信号而非完成真实任务。
阶段过渡:中训练与推理时计算
- 中训练mid-training:介于预训练与后训练之间,训练目标更为聚焦,使用大规模无标注数据,但配以更聚焦的训练目标用于系统增强复杂能力并为后训练做准备。
- 推理时计算test-time compute:推理阶段引入额外计算,指模型在回答时生成更多推理token、进行更长步骤的中间推演,以推理侧算力换取更高准确率。
- 思维链CoT:横跨预训练、后训练与推理的连接点,是一种推理行为,而非独立训练阶段。模型能够输出有条理的推理步骤源于预训练语料中包含大量分步推理文本;后训练中被放大,并成为推理时计算的载体。
数字AI与物理AI
- 机器人:复用视觉-语言骨干预训练,依托真机与仿真后训练。
- 自动驾驶:从端到端到VLA,后训练引入强化学习。
- 核心瓶颈:真机数据的稀缺,数据来源分化出海量人类操作视频、真机采集、仿真三条路线。
产业与投资视角
- 算力重心:从训练转向推理,推理正成为AI经济的重要成本中心,2025年主要厂商的推理算力占比已过半。
- 预训练的规模红利与后训练的效率红利:预训练是资本开支密集的规模竞赛,后训练则是以较小增量投入提升模型可用性和推理能力的效率竞赛。
- 中国厂商的布局:聚焦后训练与推理效率,以效率与性价比切入,如DeepSeek围绕R1、GRPO与能力蒸馏形成代表性样本。
风险提示
- 技术迭代不及预期的风险。
- 大模型厂商ARR增速放缓的风险。
- 云服务商资本开支不及预期的风险。
- 智能驾驶及机器人商业化落地不及预期的风险。