核心观点
流匹配(Flow Matching,FM)是一种新兴的生成模型框架,在图像、视频、音频、语音以及生物结构等多个领域取得了最先进的性能。本指南全面回顾了 FM,涵盖了其数学基础、设计选择及其扩展,并提供了一个包含相关示例的 PyTorch 包。
关键概念
- 流模型:由速度场定义的确定性、时间连续的双射变换,将样本从源分布转换为目标分布。
- 概率路径:连接源分布和目标分布之间的插值路径,由条件概率路径和边际概率路径组成。
- 速度场:描述样本瞬时速度的神经网络,用于定义流和概率路径。
- 流匹配损失:用于学习速度场,使其生成的概率路径尽可能接近目标分布的损失函数。
- 条件流匹配(CFM)损失:一种条件性的流匹配损失,通过条件概率路径和速度场来学习速度场。
设计选择和扩展
- 概率路径设计:可以选择不同的条件概率路径,例如固定目标样本、来源样本或双面条件。
- 速度场参数化:速度场可以使用不同的方式参数化,例如 x-预测、t-预测或分数。
- 数据耦合:源样本和目标样本可以独立耦合或通过一般概率分布相关联。
- 条件生成和指导:可以使用条件分布或引导信号来指导生成过程,例如分类器指导和无分类器指导。
- 非欧几里得流匹配:将流匹配扩展到黎曼流形,使用黎曼度量来定义概率路径和速度场。
- 离散流匹配(DFM):将流匹配扩展到离散状态空间上的连续时间马尔科夫链(CTMC),使用概率路径和速度场来学习 CTMC 模型。
- 发电机匹配(GM):一种适用于任意数据模态和通用连续时间马尔可夫过程(CTMP)的生成模型框架,统一了多种现有的生成模型。
研究结论
- 流匹配框架具有高度的灵活性和可扩展性,可以应用于各种生成任务。
- 通过选择不同的概率路径和速度场参数化方法,可以设计出适应不同应用场景的流匹配模型。
- 流匹配可以与条件生成、指导和多模态模型等技术相结合,以实现更强大的生成能力。
- 流匹配框架为理解和发展各种生成模型提供了一个统一的视角。