您问的应该是 R1 这类推理模型在推理过程中出现“循环”的现象。结合参考资料,我从几个角度来梳理一下:
推理模型(如 DeepSeek-R1)会生成长思维链来解决复杂问题,但在低温采样或贪心解码时,模型经常陷入循环,不断重复相同的文本内容 【1】 。简单说,就是模型“想不出来”时开始原地打转,反复说同样的话。
其实这个问题在 R1 的训练过程中早有体现:
根据最新的研究(2025年12月), looping 现象有几个规律 【1】 :
除了循环,R1 还存在过度深度推理的问题——把简单问题复杂化,原因可能是 SFT 阶段的推理 Query 没有区分难度;此外还有高级词汇滥用(如到处用“量子纠缠”“熵增熵减”),疑似某种形式的 reward hacking 【15】 。
推理循环本质上是推理模型的“通病”:RL 训练让模型学会了长时间思考(CoT 越长推理越准 【8】 ),但也带来了重复、过度思考等副作用。缓解方向包括:更大的模型规模、更好的训练数据分布匹配、以及在 SFT 阶段区分问题难度 【1】 【15】 。
参考来源: 【1】 arXiv:2512.12895《Wait, Wait, Wait... Why Do Reasoning Models Loop?》; 【2】 【3】 DeepSeek-R1 论文; 【4】 R1 实测报告; 【5】 R1 论文引言; 【8】 联储证券研究院报告; 【12】 R1 训练框架解析; 【15】 R1 相关技术分析
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803