核心观点
本文提出了 DELIFT(Data-Efficient Language Model Instruction Fine-Tuning),一种基于信息理论的统一数据选择框架,旨在提高大型语言模型 (LLM) 微调的效率。DELIFT 通过计算数据样本之间的互信息,评估每个样本作为上下文示例的有效性,从而选择最具信息量的数据子集。
方法
DELIFT 结合了以下关键组件:
- 成对效用度量:基于条件点互信息,量化一个样本对另一个样本预测的信息增益。
- 子模块优化:利用设施位置 (FL)、设施位置互信息 (FLMI) 和设施位置条件增益 (FLCG) 等目标,选择多样化的、信息量大的数据子集,以适应不同的微调阶段。
- 单站解决方案:DELIFT 可用于指令微调、特定任务适应和持续微调等所有微调阶段。
实验结果
在多个数据集和模型规模上进行的实验表明,DELIFT 可以在不影响性能的情况下减少高达 70% 的微调数据需求,并在有效性和效率方面比现有方法高出高达 26%。
- 指令微调:DELIFT 可以删除高达 70% 的指令数据,同时保持甚至提高性能。
- 特定任务微调:DELIFT 可以选择与目标任务最相关的样本,从而提高模型在该任务上的性能。
- 持续微调:DELIFT 可以选择与现有知识互补的新样本,同时避免冗余。
研究结论
DELIFT 证明了精心设计的效用驱动数据选择可以比单纯的数据量更有效,为更资源友好和有针对性的 LLM 微调打开了大门。未来的工作将探索将 DELIFT 与数据增强技术、公平性和偏差缓解策略以及多模态学习相结合。