摘要
本文提出了一种名为“模仿、探索和自我改进”的三阶段框架,用于训练大型语言模型(LLMs)进行慢思考推理,旨在复制类似OpenAI的o1系统。该方法的核心是使用少量长文本思考数据进行微调,使模型能够激活慢思考模式,并通过生成多个策略来探索具有挑战性的问题,从而提高模型在复杂推理任务上的表现。
方法
- 模仿学习:通过分析类似o1系统的思维过程,构建包含内部思考和最终解决方案的演示数据集,并对基础模型进行微调,使其能够生成符合要求的输出格式。
- 探索:鼓励模型通过搜索策略探索具有挑战性的问题,生成多个候选解决方案,并选择能够导向正确答案的轨迹,从而提高模型的能力。
- 自我改进:利用通过探索获得的成功轨迹进一步增强模型的能力,通过迭代优化训练数据集,持续获得比模型本身能轻易生成的更高质量的训练数据。
实验
为了验证该方法的有效性,作者在三个具有挑战性的基准上进行了广泛的实验:MATH-OAI、AIME2024和GPQA。实验结果表明,该方法在所有基准上均取得了令人鼓舞的结果,与工业级推理系统相当。
结论
- 通过模仿学习,LLMs能够有效地进行慢思考推理,并生成包含推理过程和解决方案的输出。
- 难题和跨领域数据对于提高模型的推理能力至关重要。
- 探索和自我改进方法能够有效提升慢思考能力。
- 该方法在多个基准上取得了与工业级推理系统相当的性能,为开发更强大的推理系统提供了新的思路。