摘要
核心观点:该研报从分布外泛化(OOD)的角度综述了图基础模型(GFM)的最新进展。GFM旨在通过在多样化的图和任务上进行大规模预训练来学习通用的图表示,从而解决传统图学习模型在训练分布之外泛化能力有限的问题。
关键挑战:GFM面临的主要挑战包括结构多样性、领域语义的不稳定性、模态信号的不一致性以及任务形式的多变性。这些挑战源于图结构、领域语义、可用模态和任务形式的变化,导致模型难以在未见过的环境中保持稳定的性能。
问题设定:研报提出了一个统一的OD泛化问题设定,将分布偏移归纳为结构、领域、模态和任务四个层面的变化。OD泛化的目标是学习在Φ(Φstruct, Φdom, Φmod, Φtask)变化下保持稳定的图预测函数f∗θ,以在测试分布上实现最小化预期损失。
方法分类:根据任务形式Φtask是否固定,现有方法被分为两类:
- 同质任务GFM:专注于固定任务形式的场景,如节点分类、链接预测或图级预测。这类模型通过学习在结构、领域或模态变化下保持有效的表示来实现OD泛化。代表性方法包括GraphFM、AnyGraph、MDGPT、PatchNet、GraphAny、GraphLoRA、MDGFM、SAMGPT、GraphCLIP、RiemannGFM、MDP-GNN、GraphPFN和GOODFormer。
- 异质任务GFM:设计用于支持灵活任务转换,通过显式建模任务因子的变化来实现OD泛化。这类模型通过任务无关的预训练目标、统一的语义接口和基于指令或提示的适应机制来提供共享的控制平面。代表性方法包括OFA、LLaGA、OpenGraph、GOFA、LLM-BP、GIT、GFT、AutoGFM、UniGraph和UniGraph2。
评估方法:OD泛化的评估主要关注模型在结构变化、领域差异、模态变化和任务形式变化下的性能稳定性。常见的评估任务包括:
- 结构变化下的泛化:评估模型在图拓扑或节点特征统计变化时的性能。
- 领域差异下的泛化:评估模型在不同领域数据集上的泛化能力。
- 模态变化下的泛化:评估模型在辅助模态缺失或损坏时的性能。
- 任务形式变化下的泛化:评估模型在不同任务形式(如节点级、链接级和图级)下的泛化能力。
未来方向:未来研究方向包括:
- 建立通用的图词汇表,以实现跨领域的原子单元表示。
- 建立图模型的缩放规律,以揭示数据、模型容量和性能之间的关系。
- 对齐预训练与OD目标,以设计更有效的预训练目标。
- 在图分布偏移下建立理论保证,以提供更可靠的理论支持。
- 建立更真实的OD部署场景基准,以更全面地评估模型性能。
研究结论:GFM通过大规模预训练学习通用的图表示,为解决传统图学习模型的OD泛化问题提供了新的思路。未来,随着研究的深入,GFM将在更多领域展现出其强大的泛化能力和应用潜力。