DeepSeek-R1 开创了 RL 加持下强推理慢思考范式的新边界。该模型独立发现了通往 OpenAI o1 的核心理念,并展现出强大的推理能力和长文本思考能力。DeepSeek-R1 Zero 无需监督微调 SFT,完全依赖强化学习构建,随着训练步骤增加,模型逐渐展现出长文本推理及长链推理能力,并表现出自我修复和启发式搜索的能力。
DeepSeek-R1 在数学代码任务上表现突出,在 AIME2024 上获得了 79.8% 的成绩,略高于 OpenAI-o1-1217。在 MATH-500 上,获得 97.3% 的惊人成绩,表现与 OpenAI-o1-1217 相当。在编码相关的任务中表现出专家水平,在 Codeforces 上获得了 2029 Elo 评级,在竞赛中表现优于 96.3% 的人类参与者。
DeepSeek-R1 在知识类问答上推动科学探索边界,在 MMLU、MMLU-Pro、GPQA Diamond 等 STEM-related 榜单上取得良好表现。R1 展现出强推理模型在 AI-Driven Research 的潜力,在长文本依赖任务如 FRAMEs 和事实性推断任务 Simple-QA 上表现突出。
DeepSeek-R1 Zero 的关键启示是跳过 SFT 阶段,直接运用纯强化学习拓展推理能力边界。这需要足够强的基座模型、大规模强化学习加持和规则化奖励。DeepSeek-R1 Zero 自主涌现学会重新评测原来的方法、反思和主动探索其他的路径。
DeepSeek-R1 的技术 Pipeline 包含四个阶段:推理为中心的 RL、冷启动、双重验证和全领域 RL。通过 GRPO 算法,模型在 AIME 2024 等数学基准上取得了显著提升,并自发延长推理链条,展现出更强的逻辑连贯性。
DeepSeek-R1 的技术亮点总结如下:
- 纯 RL 发展推理能力,跳过 SFT 阶段,节省标注成本,模型更自由探索。
- 多阶段训练下的冷启动让 RL 训练更加稳定,加速收敛,提升思维链可读性。
- 推理为中心的 RL 训练,兼顾推理性能、帮助性和安全性。
- 基座模型 DeepSeek-V3 超过了某个质量和能力阈值,提供了良好的 Prior Distribution 直觉。
- 大规模 RL 激活和发掘预训练阶段积累的知识和推理能力。
未来技术方向展望包括:
- 长思维链可解释性。
- 模态扩展 + 模态穿透进一步拓展强推理边界。
- 强推理能力赋能 Agentic 发展。
- 强推理模型的监管和安全保证。
- 形式化验证和审计对齐。