DeepSeek-R1-Zero 是 DeepSeek-AI 研究团队开发的推理模型,通过大规模强化学习 (RL) 进行训练,无需任何监督微调 (SFT) 数据。该模型展现出强大的推理能力,例如自我验证、反思和生成长链推理 (CoT)。然而,DeepSeek-R1-Zero 也存在可读性差、语言混杂等问题。
为了解决这些问题并进一步提升推理性能,DeepSeek-AI 推出了 DeepSeek-R1 模型。DeepSeek-R1 结合了多阶段训练和冷启动数据,并在 RL 过程中加入了推理导向的训练和拒绝采样。最终,DeepSeek-R1 在推理任务上取得了与 OpenAI-o1-1217 相当的性能。
此外,DeepSeek-AI 还探索了将 DeepSeek-R1 的推理能力蒸馏到更小模型的方法。通过使用 Qwen 和 Llama 系列模型作为基础模型,并利用 DeepSeek-R1 生成的 800K 训练样本进行微调,成功地将强大的推理能力转移到小型模型上。其中,DeepSeek-R1-Distill-Qwen-7B 在数学基准测试中取得了优异的成绩,显著优于其他指令微调模型。
实验结果表明,通过强化学习和蒸馏技术,可以有效提升语言模型的推理能力,并为未来开发更智能、更高效的模型提供了新的思路。