您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度10期:预训练与后训练如何塑造大模型? - 发现报告

汽车行业深度报告:AI系列深度10期:预训练与后训练如何塑造大模型?

交运设备 2026-07-31 东吴证券 Yàng
报告封面

AI系列深度10期:预训练与后训练如何塑造大模型? 2026年08月01日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼预训练与后训练是理解大模型能力形成的一组关键框架。预训练利用海量低成本、弱标注或无标注数据学习通用底座,决定能力来源和上限;后训练利用少量高质量指令、偏好、反馈或可验证奖励数据进行适配,决定能力的调用方式、指令遵循、偏好对齐及特定任务中的推理表现。 ◼当前模型能力与训练的关系主要聚焦三个问题:能力主要来自预训练还是后训练,后训练究竟是塑形还是可带来新推理能力;两阶段是否正在扩展为预训练、中训练、后训练三阶段;规模化重心是否从预训练转向后训练与推理时计算。 ◼数字AI与物理AI在训练框架上同构、在数据和反馈上分立。数字AI预训练主要依赖文本和图文语料,后训练依赖人类偏好、可验证奖励和工具反馈;物理AI复用视觉语言骨干,但还需要驾驶视频、机器人轨迹、真机数据、仿真环境和安全奖励。公共文本可能接近供给上限,而物理AI的核心瓶颈是真实交互数据稀缺。 相关研究 《AI系列深度09期:从LLM到VLM再到VLA意味着什么?》2026-07-31 ◼产业视角下,预训练仍属于资本开支密集的规模竞赛,后训练与推理效率则更多体现为以较小增量投入释放模型能力的效率竞赛。随着推理模型、推理时计算和Agent应用发展,部分数字AI场景的算力重心正由训练侧向推理侧迁移;中国厂商也更多围绕后训练、推理效率、MoE、长上下文和工具调用开展工程优化。总体看,预训练决定能力底座,后训练成为重要增量来源,二者互补而非替代。 《AI系 列 深 度08期 :GAN与Diffusion两类生成范式有何差异?》2026-07-31 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.术语溯源:两个概念的提出与演变............................................................................................41.2.本质区别:通用底座与面向使用的适配....................................................................................51.3.当前主要分歧:三条主线先行概览............................................................................................51.4.数字AI与物理AI:框架同构、口径分立.................................................................................5 2.1.自监督学习:以“预测下一个词”为核心目标.............................................................................52.2.扩展律Scaling Law:规模与性能的定量关系..........................................................................62.3.数据约束:高质量公共文本的供给上限....................................................................................6 3.后训练:从基座可用到对齐与推理增强..............................................................................................6 3.1.监督微调SFT:习得指令遵循能力...........................................................................................63.2.基于人类反馈的强化学习RLHF:对齐人类偏好....................................................................63.3.直接偏好优化DPO等简化路线.................................................................................................73.4.可验证奖励的强化学习RLVR:后训练的推理目标线............................................................7 4.阶段过渡:中训练与推理时计算正在重塑边界..................................................................................7 4.1.中训练mid-training:正在形成的第三阶段..............................................................................74.2.推理时计算test-time compute:推理阶段的算力投入..............................................................74.3.思维链CoT:横跨预训练、后训练与推理的连接点...............................................................8 5.数字AI与物理AI:同一框架,不同数据和反馈..............................................................................8 5.1.机器人:复用视觉-语言骨干预训练,依托真机与仿真后训练...............................................85.2.自动驾驶:从端到端到VLA,后训练引入强化学习...............................................................85.3.物理AI的核心瓶颈:真机数据的稀缺......................................................................................8 6.1.算力重心:从训练转向推理........................................................................................................96.2.预训练的规模红利与后训练的效率红利....................................................................................96.3.中国厂商的布局:聚焦后训练与推理效率................................................................................9 7.风险提示..................................................................................................................................................9 图表目录 表1:预训练与后训练的四维分工.......................................................................................................5表2:后训练主要方法对照...................................................................................................................7 1.预训练与后训练:底座形成与使用适配 预训练与后训练共同构成大模型能力形成与产品化适配的核心链条。表征、视觉骨干、序列建模和生成模型提供了不同类型的数据理解与生成能力,但这些能力需要通过训练流程沉淀为可复用的模型参数。预训练在海量数据上以自监督方式学习通用表征,形成能力底座;后训练则面向人类意图、推理任务和使用边界进行适配,使模型从具备潜在能力转向可稳定调用。 核心定义:预训练(Pre-training)是指模型在海量、低成本、无需人工标注的数据上进行自监督学习,形成具备广泛知识与泛化能力的通用底座,决定模型的知识覆盖和能力上限;后训练(Post-training)是指在该底座之上,使用规模更小但质量更高、带有人类意图或反馈信号的数据进行适配,决定模型输出方式、指令遵循、偏好对齐和任务可用性。 从功能分工看,预训练侧重于知识、语法、模式和多模态关联的广泛吸收,使模型具备通用表达与生成基础;后训练侧重于将既有能力约束到可交互、可控和可评估的产品形态,使模型能够按指令回应、遵守安全边界并输出符合任务要求的结果。我们认为,这一“通用底座形成—使用场景适配”的两阶段范式,是理解数字AI与物理AI训练流程的主线框架。 1.1.术语溯源:两个概念的提出与演变 预训练源于2006年的深度学习突破,本义是“逐层无监督初始化”:该词的技术起点可追溯至Hinton、Osindero与Teh,以及Bengio等。当时深层网络难以直接训练,研究者先以无监督方式逐层初始化参数,再进行有监督微调,pre-training指向正式训练前的参数准备。2015—2018年,迁移学习路线赋予其今日含义:Dai与Le,Howard与Ruder,Radford等,以及Devlin等,共同确立了“大规模数据自监督学习通用模型、再进行任务适配”的范式。 后训练在ChatGPT之后成为更通用的阶段性口径:在GPT、BERT时期,预训练之后的环节通常称为微调。InstructGPT确立预训练、监督微调(SFT)、基于人类反馈的强化学习(RLHF)三阶段流程后,业界逐步将预训练之后、面向使用适配的训练环节统称为post-training。此后该词被OpenAI、Meta Llama系列技术报告等沿用,外延覆盖SFT、RLHF、RLAIF、DPO直至RLVR。后训练并非单一算法,而是一组面向可用性、可控性和推理增强的工序集合。 1.2.本质区别:通用底座与面向使用的适配 由此可见,预训练决定模型内部能力的形成边界,后训练决定这些能力以何种方式被调用、约束和呈现。 1.3.当前主要分歧:三条主线先行概览 当前分歧主要集中在三条主线:其一,能力主要来自预训练还是后训练,即表层对齐假说与强化学习可带来新能力两类观点的交锋;其二,训练流程应保持两阶段划分,还是扩展为预训练、中训练、后训练三阶段;其三,规模化投入的重心是否