您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [DeepSeek]:DeepSeek-R1:通过强化学习激发大语言模型推理能力 - 发现报告

DeepSeek-R1:通过强化学习激发大语言模型推理能力

2025-05-16 - DeepSeek 艳阳天Cathy
报告封面

DeepSeek-AI research@deepseek.com 摘要 我们介绍了我们的第一代推理模型 DeepSeek-R1-Zero 和 DeepSeek-R1。DeepSeek-R1-Zero 是一个通过大规模强化学习(RL)训练的模型,没有作为初步步骤进行监督微调(SFT),它展示了卓越的推理能力。通过强化学习,DeepSeek-R1-Zero 自然地涌现出许多强大且有趣的推理行为。然而,它面临着可读性差、语言混杂等挑战。为了解决这些问题并进一步提升推理性能,我们引入了 DeepSeek-R1,该模型在强化学习之前集成了多阶段训练和冷启动数据。DeepSeek-R1在推理任务上的性能与 OpenAI-o1-1217 相当。为了支持研究社区,我们开源了 DeepSeek-R1-Zero、DeepSeek-R1 以及基于 Qwen 和 Llama 从 DeepSeek-R1 演绎出的六个密集模型(1.5B、7B、8B、14B、32B、70B)。 内容 5 2 方法 11 3 实验 14 4 讨论 贡献与致谢 20 1. 简介 近年来,大型语言模型(LLMs)正经历着快速迭代与演进(Anthropic,2024;Google,2024;OpenAI,2024a),逐步缩小了与通用人工智能(AGI)的差距。 近年来,训练后阶段已成为完整训练流程中的一个重要组成部分。研究表明,它能够提升推理任务的准确性、与社会价值观保持一致,并适应用户偏好,同时相对于预训练而言,所需的计算资源相对较少。在推理能力方面,OpenAI的o1(OpenAI,2024b)系列模型率先引入了推理时扩展,通过增加思维链(Chain-of-Thought)推理过程的长度来实现。这种方法在各种推理任务(如数学、编程和科学推理)中取得了显著改进。然而,有效测试时扩展的挑战仍然是研究界的一个悬而未决的问题。先前已有若干工作探索了各种方法,包括基于过程的奖励模型(Lightman等人,2023;Uesato等人,2022;Wang等人,2023)、强化学习(Kumar等人,2024),以及蒙特卡洛树搜索和波束搜索等搜索算法(Feng等人,2024;Trinh等人,2024;Xin等人,2024)。然而,这些方法中还没有一种实现了与OpenAI的o1系列模型相当的一般推理性能。 本文旨在通过纯强化学习(RL)提升语言模型的推理能力迈出了第一步。我们的目标是探索大型语言模型(LLMs)在没有任何监督数据的情况下发展推理能力的潜力,重点关注通过纯RL过程实现其自我进化。具体而言,我们使用DeepSeek-V3-Base作为基础模型,并采用GRPO(Shao等人,2024)作为RL框架来提升模型在推理方面的性能。在训练过程中,DeepSeek-R1-Zero自然涌现出多种强大且有趣的推理行为。经过数千次RL步骤后,DeepSeek-R1-Zero在推理基准测试中表现出超常性能。例如,其在AIME 2024上的pass@1得分从15.6%提升至71.0%,通过多数投票机制,得分进一步提高到86.7%,与OpenAI-o1-0912的性能相当。 然而,DeepSeek-R1-Zero面临着可读性差、语言混杂等挑战。为解决这些问题并进一步提升推理性能,我们引入了DeepSeek-R1,该模型融合了少量冷启动数据和多阶段训练流程。具体而言,我们首先收集数千条冷启动数据,用于微调DeepSeek-V3-Base模型。随后,我们执行类似DeepSeek-R1-Zero的推理导向强化学习。当强化学习过程接近收敛时,我们通过在强化学习检查点上进行拒绝采样来创建新的SFT数据,并结合来自DeepSeek-V3在写作、事实性问答和自我认知等领域的监督数据,然后重新训练DeepSeek-V3-Base模型。在用新数据微调后,检查点会经历额外的强化学习过程,并考虑所有场景中的提示。经过这些步骤后,我们获得了一个称为DeepSeek-R1的检查点,其性能与OpenAI-o1-1217相当。 我们进一步探索了从 DeepSeek-R1 向更小稠密模型的知识蒸馏。以 Qwen2.5-32B (Qwen, 2024b) 为基础模型,直接从 DeepSeek-R1 进行蒸馏的表现优于对其应用强化学习。这表明大型基础模型发现的心智模式对于提升推理能力至关重要。我们开源了蒸馏后的 Qwen 和 Llama (Dubeyet al., 2024) 系列。值得注意的是,我们蒸馏的 14B 模型大幅超越了最先进的开源 QwQ-32B-Preview (Qwen, 2024a),而蒸馏的 32B 和 70B 模型在稠密模型的推理基准测试中创下了新纪录。 1.1. 贡献 训练后:在基础模型上进行大规模强化学习 • 我们直接将强化学习(RL)应用于基础模型,而无需将其作为初步步骤依赖监督微调(SFT)。这种方法使模型能够探索思维链(CoT)以解决复杂问题,从而开发出DeepSeek-R1-Zero。DeepSeek-R1-Zero展示了自我验证、反思以及生成长思维链等能力,为研究界标志着一个重要的里程碑。值得注意的是,这是首个公开研究验证LLM的推理能力可以通过纯粹的强化学习来激励,而无需SFT。这一突破为该领域的未来进步铺平了道路。 我们介绍了用于开发 DeepSeek-R1 的流程。该流程包含两个强化学习阶段,旨在发现更优的推理模式并与人偏好保持一致,以及两个监督微调阶段,作为模型推理和非推理能力的种子。我们相信该流程将通过创建更好的模型来惠及行业。 蒸馏:小模型同样可以很强大 我们证明了大型模型的推理模式可以被蒸馏到小型模型中,从而获得比通过在小型模型上使用强化学习发现的推理模式更好的性能。开源的 DeepSeek-R1 及其 API 将有助于研究界在未来蒸馏出更好的小型模型。 • 基于DeepSeek-R1生成的推理数据,我们对研究社区广泛使用的几个密集模型进行了微调。评估结果表明,蒸馏后的小型密集模型在基准测试中表现优异。DeepSeek-R1-Distill-Qwen-7B在AIME 2024上达到55.5%,超越了QwQ-32B-Preview。此外,DeepSeek-R1-Distill-Qwen-32B在AIME 2024上获得72.6%,在MATH-500上达到94.3%,在LiveCodeBench上达到57.2%。这些结果显著优于之前的开源模型,并与o1-mini相当。我们向社区开源了基于Qwen2.5和Llama3系列蒸馏的1.5B、7B、8B、14B、32B和70B检查点。 1.2. 评估结果摘要 • 推理任务: (1) DeepSeek-R1 在 AIME 2024 上取得了 79.8% 的 Pass@1 分数,略微超过OpenAI-o1-1217。在 MATH-500 上,它获得了 97.3% 的亮眼成绩,表现与 OpenAI-o1-1217相当,并显著优于其他模型。 (2) 在与编程相关的任务中,DeepSeek-R1 在代码竞赛任务中展现出专家级水平,其在 Codeforces 上获得了 2,029 Elo 评分,超过了 96.3% 的参赛者。对于工程相关任务,DeepSeek-R1 的表现略优于 DeepSeek-V3,这有助于开发者在实际任务中提升效率。 • 知识:在MMLU、MMLU-Pro和GPQA Diamond等基准测试中,DeepSeek-R1取得了优异的成绩,显著优于DeepSeek-V3,其分数分别为MMLU 90.8%、MMLU-Pro 84.0%和GPQA Diamond 71.5%。虽然在这些基准测试上的表现略低于OpenAI-o1-1217,但DeepSeek-R1超越了其他闭源模型,在教育任务中展现了其竞争优势。在事实基准测试SimpleQA上,DeepSeek-R1的表现优于DeepSeek-V3,证明其在处理基于事实的查询方面的能力。与此趋势相似,在SimpleQA基准测试上,OpenAI-o1也超越了4o。 • 其他:DeepSeek-R1 在多种任务上表现优异,包括创意写作、通用问答、编辑、摘要等。它在 AlpacaEval 2.0 上取得了 87.6% 的长度可控胜率,在 ArenaHard 上取得了 92.3% 的胜率,展现了其智能处理非应试类查询的强大能力。此外,DeepSeek-R1 在需要长上下文理解的任务上表现突出,在长上下文基准测试中大幅超越了 DeepSeek-V3。 2. 方法 2.1. 概述 以往研究高度依赖大量监督数据来提升模型性能。在本研究中,我们证明,即使不使用作为冷启动的监督微调(SFT),通过大规模强化学习(RL)也能显著提升推理能力。此外,加入少量冷启动数据可以进一步提升性能。以下章节我们将介绍:(1) DeepSeek-R1-Zero,该模型直接将RL应用于基础模型,不使用任何SFT数据;(2) DeepSeek-R1,该模型从经过数千个长链式思维(CoT)示例微调的检查点开始应用RL。3) 将DeepSeek-R1的推理能力蒸馏到小型密集模型中。 2.2. DeepSeek-R1-Zero:在基础模型上的强化学习 强化学习在推理任务中已展现出显著的有效性,正如我们先前的工作(Shao等人,2024;Wang等人,2023)所证明的那样。然而,这些工作严重依赖于监督数据,而收集这些数据需要耗费大量时间。在本节中,我们探索了大型语言模型(LLMs)在没有任何监督数据的情况下发展推理能力的潜力,重点关注它们通过纯粹的强化学习过程实现自我进化的能力。我们首先简要概述我们的强化学习算法,然后展示一些令人兴奋的结果,希望能为社区提供有价值的见解。 2.2.1. 强化学习算法 为了节省强化学习的训练成本,我们采用组相对策略优化(GRPO)(Shao等人,2024),它省略了通常与策略模型规模相同的评价模型,并从组分数中估计基准。具体来说,对于每个问题푞,GRPO从旧策略휋中采样一组输出{표, 표, ..., 표} ∈ 퐺,然后通过最大化以下目标来优化策略模型휋휃휃:표푙푑 其中 휀 和 훽 是超参数,퐴푖 是优势值,它使用与每个组内的输出相对应的一组奖励 {푟₁, 푟₂, ..., 푟<0xE2><0x82><0x99>}<0xE2><0x82><0x99>₂₁ 퐺 计算得出。 用户:提示。助手:思考过程在这里答案在这里 表1 | DeepSeek-R1-Zero模板。在训练期间,prompt将被具体的推理问题替换。 2.2.2. 奖励建模 奖励是训练信号之源,它决定了强化学习(RL)的优化方向。为了训练DeepSeek-R1-Zero,我们采用了一种基于规则的奖励系统,该系统主要由两种类型的奖励组成: • 准确性奖励:准确性奖励模型用于评估回答是否正确。例如,对于具有确定性结果的数学问题,模型需要以指定格式(例如,置于方括号内)提供最终答案,从而能够进行可靠的基于规则的正确性验证。类似地,对于 LeetCode 问题,可以使用编译器根据预定义的测试用例生成反馈。 • 格式奖励:除了准确性奖励模型外,我们还采用格式奖励模型,要求模型将其思考过程置于“”和“”标签之间。 我们开发DeepSeek-R1-Zero时没有应用结果或过程神经奖励模型,因为我们发现神经奖励模型在大规模强化学习过程中可能会遭受奖励攻击,并且重新训练奖励模型需要额外的训练资源,这会使整个训练流程变得复杂。 2.2.3. 训练模板 为训练DeepSeek-R1-Zero,我们首先设计了一个简洁的模板,指导基础模型遵循我们指定的指令。如表1所示,该模板要求DeepSeek-R1-Zero首先生成推理过程,然后给出最终答案。我们有意将约束限制在这个结构化格式中,避免任何