基础模型:期望与现实的差距
基础模型,如Meta发布的Segment Anything模型(SAM),在训练中使用了大量高质量的分割掩码,但其在实际应用中却面临着诸多挑战。例如,在Segment Anything模型中,用户需要通过“试错”的方式来进行目标分割,这导致标注效率低下且效果不佳。此外,视觉语言模型(VLMs)在处理长视频序列、识别细粒度层次活动、应对领域转换输入以及消除社会刻板印象等方面也存在着明显的局限性。
深度学习在训练和推理中的挑战
深度学习在训练和推理过程中都面临着诸多挑战。在训练阶段,如何有效地利用新型数据源(如异常数据、分布外数据、对抗数据等)是一个重要问题。在推理阶段,由于模型知识难以获取,如何处理未知数据分布、异常数据、对抗攻击等成为一大难题。
推理中的信息获取
尽管在推理阶段模型知识难以获取,但仍然可以通过梯度信息来获取一些隐含知识。梯度可以提供关于潜在数据分布的信息,并用于构建局部对比性流形,从而帮助模型更好地处理未知数据。此外,梯度还可以用于解释模型的预测结果,例如通过Grad-CAM、Counterfactual-CAM和Contrast-CAM等方法来识别模型关注的图像特征。
不确定性与可干预性
不确定性是模型对其自身能力的一种认知,即模型知道它不知道。不确定性量化(UQ)旨在提供模型预测结果及其不确定性的度量。梯度信息可以用于UQ,例如通过反事实梯度方法来评估模型对未知数据的预测信任度。此外,不确定性还可以用于解释模型的可干预性,例如通过Introspective Learning方法来模拟人类的内省过程,从而提高模型的鲁棒性和可解释性。
公平性干预
基础模型在公平性方面也存在着诸多挑战,例如训练数据中的偏差会导致模型在下游任务中产生不公平的预测结果。为了解决这一问题,可以采用数据平衡、重采样、重加权等方法来减少训练数据中的偏差。此外,还可以采用Selective Feature Imputation for Debiasing (SFID)等方法来对基础模型进行公平性干预,从而提高模型在跨模态任务和下游任务中的公平性。
核心观点与结论
- 基础模型在期望与现实之间存在差距,面临着诸多挑战,例如试错式交互、领域转换、社会刻板印象等。
- 深度学习在训练和推理过程中都面临着诸多挑战,例如如何有效地利用新型数据源、如何处理未知数据分布等。
- 梯度信息可以用于获取模型隐含知识,并用于解释模型的预测结果、量化不确定性以及进行公平性干预。
- 不确定性是模型对其自身能力的一种认知,可以通过梯度信息来进行量化,并用于提高模型的可解释性和可干预性。
- 基础模型在公平性方面也存在着诸多挑战,可以通过数据平衡、重采样、重加权以及SFID等方法来减少训练数据中的偏差,并提高模型的公平性。