深度基础模型研报正文总结
2.1 深度基础模型的定义
深度基础模型是在语言模型领域发展的基础上,通过学习大规模数据集和大规模模型参数,实现对多种数据域的强泛化能力。深度基础模型通常需要满足以下条件:训练数据集规模超过 1000 万张图像,模型参数数量超过 10 亿,并具备跨多个数据域的强泛化能力。
2.2 深度估计任务
本研报主要关注利用深度学习进行深度估计的方法,特别是使用大规模架构和大量数据集的基础模型。深度估计任务包括:
- 单目图像深度估计:从单张 RGB 图像预测场景的逐像素深度。
- 立体图像深度估计:利用双目相机图像对进行深度估计,具有尺度信息。
- 多视图图像深度估计:利用多个视角的图像进行深度估计,融合多视图信息。
- 单目视频深度估计:从单目视频序列进行深度估计,需要考虑时间一致性。
2.3 深度估计概述
深度估计方法经历了从传统几何方法到数据驱动端到端学习范式的演变。主要范式包括:
- 单目图像深度估计:从直接深度回归到仿射不变深度、深度分类和规范相机深度,逐步提高精度和泛化能力。
- 立体图像深度估计:从成本体积方法到注意力机制、迭代优化技术,并利用单目和扩散先验进行大规模训练。
- 多视图图像深度估计:从基于 PatchMatch 的立体匹配策略到成本体积方法、由粗到细的策略和 token 注意力机制。
- 单目视频深度估计:利用时间相关性和测试时优化范式,结合尺度扩展,提高深度估计的稳定性和准确性。
2.4 单目图像深度估计
单目图像深度估计方法从早期的直接回归和分类方法,发展到仿射不变深度、规范相机深度和深度分类,并逐步转向深度基础模型。主要方法包括:
- 模型架构:从早期的卷积神经网络到 U-Net、ResNet,再到密集预测 Transformer (DPT) 和基于扩散的生成模型。
- 数据规模:从数千到数百万张图像,并倾向于使用大规模数据集进行训练。
- 有价值的问题:深度精度、绝对尺度恢复、数据效率瓶颈和多任务泛化。
2.5 立体图像深度估计
立体图像深度估计方法从成本体积方法发展到注意力机制和迭代优化技术,并利用单目和扩散先验进行大规模训练。主要方法包括:
- 模型架构:基于卷积神经网络的成本体积范式、基于 Transformer 的注意力范式和基于 RNN 的迭代优化范式。
- 基础模型:利用单目深度模型作为先验,或利用立体几何尺度单目深度估计。
- 数据规模:从高保真虚拟场景到从单目数据合成立体数据。
- 有价值的问题:数据有限、缺乏端到端训练范式、数据集利用率不足和扩散架构和先验的利用不足。
2.6 多视图图像深度估计
多视图图像深度估计方法从早期的启发式匹配发展到基于 Transformer 和扩散的模型。主要方法包括:
- 模型架构:从基于 PatchMatch 的匹配策略到成本体积方法、由粗到细的策略和 token 注意力机制。
- 基础模型:主要基于 Transformer 架构,如 MVSTR、MVSFormer、MVSFormer++、PF-LRM 和 DUSt3R。
- 数据规模:从小规模数据集发展到大规模训练,如 Objaverse 和 MVImgNet 数据集。
- 有价值的问题:稀疏视图重建、细粒度深度估计和复杂材料物体的深度估计。
2.7 单目视频深度估计
单目视频深度估计方法利用时间相关性和测试时优化范式,结合尺度扩展,提高深度估计的稳定性和准确性。主要方法包括:
- 模型架构:从基于 RNN 的时间建模到基于 CNN 的测试时优化,再到基于 Transformer 的扩展和基于视频扩散的模型。
- 数据规模:从 NVDS 数据集到利用视频生成模型创建的合成数据。
- 有价值的问题:几何不一致性和时间不一致性。
2.8 视频世界模型
视频扩散模型可以用于视频生成,并探索其作为世界模型的能力。深度基础模型可以增强视频生成模型对 3D 空间的理解。
2.9 机器人与自动驾驶
深度基础模型在机器人与自动驾驶领域具有重要作用,可以用于导航、障碍物检测和碰撞避免等任务。单目深度估计可以集成到机器人感知管道中,作为更昂贵传感器的补充或替代。
2.10 未来工作
深度基础模型面临的主要挑战是数据和一致性:
- 数据:缺乏准确、大规模、高质量和高可变性的数据集。
- 一致性:单目图像深度估计结果在不同时间戳和视口之间难以合并,视频深度估计在多个视口之间难以产生准确和一致的结果。
2.11 结论
深度基础模型在计算机视觉领域取得了显著进展,为 3D 重建、新视角合成、机器人与自动驾驶等应用提供了新的可能性。未来需要解决数据和一致性问题,以实现通用深度基础模型。