SELF-DISCOVER:大型语言模型自组合推理结构
核心观点:
SELF-DISCOVER 是一种使大型语言模型(LLM)能够自主发现并组合原子级推理模块,构建任务特定推理结构的方法。该方法灵感来源于人类解决问题时的内部推理过程,旨在提高 LLM 在复杂推理任务中的效率和性能。
方法:
SELF-DISCOVER 分为两个阶段:
- 自发现阶段:通过三个元提示(选择、调整、实施)引导 LLM 从一组预定义的原子推理模块中选择、适应并组合成一个针对特定任务的推理结构,格式化为 JSON 格式。
- 任务解决阶段:LLM 遵循自我发现的推理结构,逐步填写关键点以生成最终答案。
实验设置:
- 任务:25 个具有挑战性的推理任务,包括 BigBench-Hard (BBH)、为做事而思考 (T4D) 和数学 (MATH)。
- 模型:GPT-4、GPT-3.5-turbo、指令调谐的 PaLM 2-L 和 Llama2-70B。
- 基线方法:直接提示、思维链 (CoT)、计划与解决 (PS)、CoT-自我一致性、每个模块的多数投票、OPRO 等。
关键数据和研究结论:
- 性能提升:SELF-DISCOVER 在 21/25 个任务上超越 CoT,性能提升最高达 42%。在 PaLM 2-L 和 GPT-4 上,准确率分别达到 69% 和 85%,显著优于其他基线方法。
- 效率优势:相较于 CoT-自我一致性等耗时方法,SELF-DISCOVER 的推理计算量减少 10-40 倍。
- 通用性:自我发现的推理结构在不同模型(PaLM 2-L 到 GPT-4,再到 Llama2)中具有可迁移性,且与人类推理模式存在共通之处(如逐步心理笔记)。
- 错误分析:74.7% 的模型错误源于中间计算错误(如数学运算),而非推理结构错误。
- 消融研究:选择、调整和实施三个步骤都对性能提升有显著贡献,其中实施步骤最为关键。
- 与 OPRO 的比较:SELF-DISCOVER 在零样本设置下表现优于 OPRO,且结构更可解释。
研究意义:
SELF-DISCOVER 为 LLM 推理提供了一种高效且可解释的解决方案,通过自组合推理模块避免了先验知识的局限性,并展示了人机协作解决复杂问题的潜力。