世界模型如何实现?
概念溯源与辨析
世界模型的概念源于三条相互独立的脉络:认知科学中的“小尺度现实模型”、系统动力学中的“全球系统动力学仿真”以及模型式强化学习与神经世界模型传统。三者虽在具体所指和技术目标上存在差异,但共同关注对环境状态及其演化规律的建模。在当前人工智能语境下,世界模型特指智能体用于预测行动后果,并支持规划与决策的内部环境模型。
各方图谱与分歧根源
世界模型在数字AI与物理AI领域同时升温。数字AI领域的主要参与者包括OpenAI、Google DeepMind、World Labs等,物理AI领域的主要参与者包括Wayve、NVIDIA、小鹏等。世界模型的分歧主要源于四个环节:预测空间(生成观测结果 vs 预测抽象状态)、输出真实性(视觉真实 vs 物理一致)、与动作结合方式(松耦合、训练级融合、架构级融合)以及产业落地进度。其中,生成式与非生成式JEPA的路线分歧是最核心的争议点。
本质分歧与路径分化
世界模型的核心问题是构建智能体的内部环境表征,使其能够理解当前状态、预测环境后续演化,并据此进行规划。分歧在于以何种技术路径解决该问题。生成式路线直接生成未来画面、观测或视频,而非生成式路线(JEPA)则在抽象表征空间中预测下一状态。生成式路线内部还可分为自回归和扩散两条实现路径。输出真实性方面,生成式路线可分为渲染器(强调视觉逼真)和模拟器(强调物理一致性)两类。与动作结合方式方面,世界模型可与动作模型松耦合、训练级融合或架构级融合。产业落地进度方面,生成式路线已出现量产或商业化样本,而非生成式路线尚处验证期。
落地视角与瓶颈
自动驾驶是世界模型落地最深的场景,形成了数据飞轮闭环:量产车队回传数据,云端世界模型重建和生成场景,策略在虚拟环境中训练与评估,再通过OTA回到车端形成数据飞轮。机器人需求强度最高但进展仍处早期。三大场景的瓶颈最终收敛到物理一致性不足、长时序不稳、评测无公认标准。
研究结论
数字AI底座模型发展路径已逐渐清晰,但其难以实现物理世界的建模闭环。物理AI将成为物理世界的AI解决方案,并在AI的当前发展阶段成为增量更大的方向。智能驾驶作为最先跑通闭环的代表场景,应重点关注。