WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
任务定义与对比
- 自动驾驶模拟世界手段:视频生成 vs 场景重建
- 视频生成:根据结构控制条件和文本提示生成自动驾驶视频,借助Wan2.1等Diffusion架构实现高度真实视频生成,但缺乏空间记忆,易出现场景不一致问题。
- 场景重建:基于3D/4D Gaussians表征,可准确重建场景结构,但在新视角合成时存在模糊现象,无法像Diffusion生成效果清晰。
优势与困境
- 视频生成:
- 优势:生成质量大幅提升(如MagicDrive),支持闭环仿真(DriveArena),实现动态场景交互。
- 困境:缺乏空间记忆,闭环仿真中场景一致性不足。
- 场景重建:
- 优势:可复现性高,但逐场景拟合方案难以还原稀疏视角下的3D场景。
世界模型设计思路
- 动机:以Gaussians为核心,生成表示空间的4D Gaussians表征,同时借助Diffusion生成多视角一致视频。
- 双阶段流程:
- 生成4D高斯表征,表示空间并渲染新视角视频。
- 优化渲染视频,提升最终质量。
提出的世界模型框架
- 核心框架:
- 四维感知扩散模型生成多模态潜在表示(RGB、深度、动态)。
- 前馈潜在表示解码器预测三维高斯球,并进行动静态分解形成四维高斯。
- 根据模拟轨迹渲染新视角视频,并使用增强型扩散模型提升分辨率和时间一致性。
实验结果
- 视频生成效果:
- 对比最新方法,FID和FVD指标表现优异,支持首帧图像输入和无图像输入模式。
- 视觉效果:模拟阴雨天气(潮湿路面车灯反射、玻璃反射),复杂交通流(密集行人、车辆拐弯)效果逼真。
- 新视角生成效果:
- 模拟自车水平位移1~4m,FID、FVD指标优于最新重建方法。
- 视觉效果:实现不同视角场景一致性,如左右平移1m、2m的场景渲染。
消融实验与下游应用
- 消融实验:验证提出策略的有效性。
- 下游应用:提升感知任务效果。
未来工作
- 整理代码开源。
- 轻量化生成框架。
- 在闭环仿真任务中评估模型效果。
学习路线推荐
- 视频生成:
- GitHub网站:Awesome-World-Model。
- 开源方案:MagicDrive-V2。
- 团队工作:
- Genesis:多模态驾驶场景生成框架。
- 可编辑生成模型:通过3D资产编辑实现精准控制。
- 前馈重建:
- 推荐模型:VGGT, CUT3R, StreamVGGT, Pi3, HunyuanWorld-Mirror, Depth Anything3。
- 推荐论文:
- Omni-Scene:Nuscenes场景前馈式3D重建。
- STORM:前馈式动态场景重建。