-
模型架构与混合模式
DeepSeek V3.1 采用单一模型支持思考/非思考模式,与 GPT-5 的多模型系统殊途同归,全球趋势为此方向(阿里Qwen曾尝试后放弃)。
-
效率提升
相比 V3 和 R1,V3.1 及 V3.1 Think 达到同等效果需更少 token,体现提效而非性能通缩(后续可通过算力补充)。
-
Agent 能力增强
后训练强化工具使用能力,Agent 任务表现显著提升,利好应用开发,尤其 Agent 类应用。
-
预训练优化
V3.1 Base 在 V3 基础上新增 840B tokens(外扩训练,占 V3 总量约 5.7%),推测含 Agent 数据,预训练持续进行。
-
关键参数调整
- 上下文扩展至 128k(恢复 V3 论文支持,原因成本优化至 64k)。
- 采用 UE8M0 FP8 精度,明确适配“下一代国产芯片设计”,具体编码(E4M3/E5M2 的缩放)待定。