AI系列深度11期:大模型如何进行模仿与强化学习?
智能体学习路径:模仿与强化
智能体学习主要包含模仿学习和强化学习两条路径。模仿学习通过专家示范学习状态到动作的映射,优点是训练快、稳定性高,但存在分布漂移和示范者上限问题。强化学习通过环境交互和奖励信号优化策略,在可构造奖励、仿真环境或可验证任务中能突破示范上限,但面临功劳分配、探索与利用、奖励稀疏和样本效率等难点。工程实践中常采用先模仿形成初始策略,再强化优化的组合范式。
强化学习概述
强化学习解决没有逐步标准答案、只有事后奖励反馈的决策问题,核心思想源于行为主义心理学和贝尔曼MDP,经Sutton与Barto体系化,并在DQN、AlphaGo、RLHF、RLVR和推理模型中持续演进。近年来,强化学习从补充性优化工具转向后训练、偏好对齐和可验证推理的重要方法。
强化学习在大模型中的应用
强化学习主要用于大模型的后训练阶段,而非预训练。预训练通过自监督学习形成通用表征,监督微调(SFT)本质上是模仿学习,RLHF和RLVR再通过人类偏好或可验证奖励进行精修。AlphaGo先学棋谱再自我对弈,ChatGPT先SFT再RLHF,机器人VLA先示范预训练再仿真或真实环境强化,均体现组合范式。
样本效率争议
杨立昆的“蛋糕论”认为自监督学习是学习世界表征的主体,强化学习样本效率较低,难以单独从零建立世界模型。但认为该观点适用于表征学习阶段,在已有预训练底座后,强化学习在偏好对齐、可验证推理和策略优化中的作用正在上升。
模仿学习
行为克隆是模仿学习的基础形式,但存在分布漂移问题。缓解方法包括逆强化学习(从示范反推奖励函数)和交互或对抗式模仿方法(如DAgger、GAIL)。
两者分工
模仿学习训练快、稳定性高,但受限于示范者上限;强化学习在可构造奖励、仿真或可验证任务中能突破示范上限,但训练慢、稳定性弱、试错成本高。二者常组合使用。
工程范式
工程实践采用先模仿形成初始策略,再强化优化的两段式路径。典型系统如AlphaGo、ChatGPT类大模型、机器人VLA模型,均体现该思路。逆强化学习提供两者之间的桥梁,先形成初始能力,再进行目标优化。
落地到智能驾驶与具身智能
自动驾驶目前仍以模仿学习为基础,但真实物理世界限制了直接强化试错。长尾场景是关键难题,纯行为克隆难以覆盖罕见危险场景,趋势是先用模仿学习建立基础策略,再用仿真、强化学习与世界模型补足长尾。产业侧正在同时推进模仿学习与强化学习工具链。
风险提示
技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。