主流观点认为,通过在大型语言模型(LLM)上规模化强化学习(RL)是实现通用人工智能(AGI)的最直接路径,即通过“预烘焙”技能打造超人能力。然而,现实中的机器人难题暴露了基础能力的缺失,当前产业链依赖构建RL环境进行技能训练,但缺乏人类的学习泛化能力。
关键症结在于,人类工作者无需为每个微小任务建立专门训练流程,而AI模型则面临经济上的不可行性。全球知识工作者年薪数十万亿美元,而当前AI模型年收入仅数十亿美元,这种巨大差距并非市场渗透缓慢,而是模型能力与人类能力的真实差距。
技术扩散缓慢的论调是自我安慰,若模型具备人类学习能力,其扩散速度将极快。因此,当模型解决常识、推理等瓶颈但未产生AGI级别经济影响时,应反思对AGI的定义过于狭隘,需根据新证据更新认知。
规模化的幻觉:强化学习(RL)和预训练(Pre-training)并非所有Scaling都生而平等,当前缺乏公开可靠的Scaling Law。Toby Ord分析表明,需将RL计算量扩大约100万倍才能获得GPT级别迭代提升,且每笔交易都亏钱,仅靠走量弥补。
逻辑漏洞在于,指望缺乏基本学习能力的AI解决AGI算法难题不合情理。流行的反驳观点是构建超人AI研究员去解决稳健学习问题,但缺失的是持续学习(Continual Learning)能力,即模型动态学习新技能和适应新环境的能力。
AGI的未来:一个学习中的蜂巢思维(Hive Mind),但现实路径是渐进的,需5-10年逐步完善在职学习能力,首个破解持续学习的模型不会带来失控式收益。
竞争将持续激烈,“赢家通吃”论站不住脚,硅谷人才挖角和常规逆向工程持续进行,三大模型公司轮流领先,动态平衡中和单一实验室优势。
真正重要的问题是“我们到底在规模化什么?”,而非“何时”到来。规模化学习能力(Scaling the Ability to Learn)将决定未来道路和投资方向。