总结
可解释性
- LLM 时代的可解释性:随着 GPT-3 等大型语言模型的发展,模型的可解释性成为关注焦点。LLM 能够生成看似合理的解释,但其黑匣子特性在需要可信度保障的场景中存在问题,且处理大量数据时成本高昂。
- 对可解释性的期望:可解释性方法需兼顾忠实性(反映模型行为)和似是而非(符合人类理解)。
- 可解释性方法:分为事后方法(需要额外代理模型解释现有模型)和事前方法(将解释性纳入模型设计)。
合作自我解释框架:RNP 和杂散相关性
- 合理化神经预测 (RNP):利用合作博弈框架,通过解释器识别人类可解释子集(基本原理)并传递给预测器进行预测,显著优势在于例外认证,确保未被选中的输入部分对预测无贡献。
- RNP 的目标:通过 Gumbel-softmax 或强化学习进行理由选择,实现合作预测,且 RNP 具有域无关性。
- RNP 中的杂散相关性:包括特征相关性和退化(掩码相关),前者源于数据集生成过程,后者源于基本原理选择,可能导致模型过度适应无意义但可区分的选择。
对合作博弈和 RNP 中虚假关联解决方案的见解
- 解决方案:
- 折叠合理化 (FR):将解释器和解码器阶段合并,使用统一编码机制,提高 F1 得分 10.3%。
- 解耦合理化 (DR):将预测器的学习率设置为低于生成器,通过 Lipschitz 连续性约束,改善基本原理质量。
- 多生成器合理化 (MGR):同时解决特征相关性和退化问题,通过多个发电机提供多样化的理由候选,最终仅保留一个发电机进行推理。
研究结论
- FR:简单有效,通过统一编码机制实现生成器和预测器之间的相互强化。
- DR:通过不对称学习率合作博弈,结合 Lipschitz 连续性约束,进一步改善性能。
- MGR:首次同时解决特征相关性和退化问题,通过多样化培训提升理由多样性,最终性能优于现有方法。
未来工作
- 将合作博弈的见解扩展到其他领域(如 GNN)。
- 在基于因果推理的统一框架内处理特征相关性和退化问题。