Seed1.5-Thinking 研报总结
模型介绍
Seed1.5-Thinking 是一款能够通过思考进行推理的模型,在多个基准测试中表现出色。它在 AIME2024、Codeforces 和 GPQA 上分别取得了 86.7、55.0 和 77.3 的成绩,展现了在 STEM 和编码方面的优秀推理能力。此外,该模型在非推理任务中也表现出显著的泛化能力,例如在非推理任务上的胜率比 DeepSeek R1 高 8%。
模型特点
Seed1.5-Thinking 是一个 Mixture-of-Experts (MoE) 模型,参数量相对较小,激活参数为 20B,总参数量为 200B。为了评估模型的泛化推理能力,研究人员开发了两个内部基准测试 BeyondAIME 和 Codeforces,并将公开发布以支持未来的研究。
模型训练
模型训练主要涉及三个关键点:训练数据、RL 算法和 RL 基础设施。
数据
- RL 训练数据:包括可验证问题(STEM 问题、代码问题和逻辑推理)和非可验证问题(非推理任务)。
- 可验证问题:STEM 数据(数学、物理和化学问题)、代码数据(带单元测试的编码问题)和逻辑谜题数据(如 24 点、迷宫、数独等)。
- 非可验证问题:主要涵盖需要根据人类偏好进行质量评估的非推理任务,如创意写作、翻译、知识问答、角色扮演等。
- 高级数学基准:为了更好地评估数学推理能力,研究人员构建了一个新的基准数据集 BeyondAIME,包含 100 个由人类专家精心设计的、难度不低于 AIME 最难问题的数学问题。
RL 算法
- 奖励建模:针对可验证问题和非可验证问题采用了不同的奖励建模方法。可验证问题使用 Seed-Verifier 和 Seed-Thinking-Verifier 进行奖励建模,非可验证问题使用 pairwise rewarding 方法进行奖励建模。
- RL 训练:采用统一的强化学习框架,融合了来自不同领域的多种数据,并使用了多种技术来应对长 CoT RLHF 中的挑战,如价值模型偏差和奖励信号的稀疏性。
RL 基础设施
- 框架:使用 HybridFlow 编程抽象构建训练框架,并在 Ray 集群上运行。
- Streaming Rollout System:采用流式展开架构,将模型进化与运行时执行解耦,并通过参数 α 动态调整 on/off-policy 样本比例。
- Training System:设计了一个混合分布式训练框架,集成了先进的并行策略、动态工作负载平衡和内存优化技术。
实验结果
- 自动评估结果:Seed1.5-Thinking 在数学推理、代码生成和科学任务上均取得了优异的成绩,但在 SimpleQA 上表现相对较弱。
- 人工评估结果:在非推理场景中,Seed1.5-Thinking 在 8.0% 的评估会话中取得了胜利,表明其在与人类偏好保持一致方面具有优势。
- 预训练模型的影响:拒绝采样初始化 RL 可以加速训练,但最终性能低于未使用拒绝采样的模型。不同规模的模型在 RL 算法排名上表现出一致性。
研究结论
Seed1.5-Thinking 是一款优秀的推理模型,在推理和非推理任务上均取得了出色成绩。未来研究计划探索更高效的 RL 配方、更具挑战性的思考模式任务,以及更通用的奖励建模方法。