核心观点与问题提出
- 传统的语言模型多采用Next Token Prediction范式,解码时严格按固定顺序进行。
- 近年来,扩散大语言模型(DLM)通过任意顺序去噪,打破顺序约束,实现并行解码和任意顺序生成,但灵活性是否真正扩大了推理边界?
实验设计与结果
- 使用Pass@k作为衡量推理边界的代理指标,k代表采样次数。
- 对比同一DLM模型在自回归顺序(AR)和任意顺序(AO)下的Pass@k曲线:
- k=1时,AO略优于AR。
- k增大后,AR顺序逐渐拉开差距,k=128时AR显著优于AO。
- 在多个模型和基准测试中,AR顺序始终表现更好。
- 可实现的解的集合分析显示,AO能解出的题仅占1%以下,远低于AR。
灵活性陷阱的成因
- AR顺序:逐个token推进,遇到不确定时当场决策,分支保持开放,允许多次尝试探索。
- AO顺序:基于置信度优先处理易token,跳过难token,导致后续上下文固定,分支过早坍缩,推理路径变少。
对推理潜力的影响
- AO绕开不确定token,损害R1后训练效果,R1训练本质是锐化可达集合而非注入新内容。
- AO下,模型能用于强化学习的路径更少,限制了R1训练的潜力。
解决方案:Just GRPO
- 提出仅R1训练阶段使用自回归顺序,推理阶段保留并行解码。
- Just GRPO简单有效,兼容标准GRPO流程,无需新损失函数或架构设计。
- 实验结果:Just GRPO在推理任务中表现优于基座模型,并行解码能力得到保留甚至增强。
未来方向
- Just GRPO是避开陷阱的简单方法,但更理想的是设计能主动鼓励探索的AO解码方式。
- 开放问题:如何修复灵活性陷阱,进一步释放DLM潜力。
回答线上问题
- AO是否会破坏语序信息?
- AO在规划任务(如数独)中表现优异,但在强因果性任务(如数学、代码)中仍保留较强自回归性。
- AO模型不会变成纯AR模型,因为:
- 仍为DLM,未改变架构和注意力机制。
- R1训练是锐化而非注入知识,且过程短(约100步)。
- 并行解码能力得到保留。
- R1训练后基于entropy或confidence的解码方法是否最优?
- 目前尚无最优解码方法,但基于entropy或confidence的方法在实践中表现较好。
- R1训练可能改变解码方法的优劣排序,但需进一步研究。
- 并行解码依赖confidence解码,因为高置信度token间依赖低,易于同时解码。
- 评测DLM的benchmark
- 效率层面:使用通用基准(如GSM8K)测试并行解码token数。
- 效果层面:
- 关注通用任务表现,使用通用基准。
- 测试DLM独特优势,使用小众基准(如数独、Zebra Puzzle)。
- AO对agent应用的影响
- 某些reasoning任务(如agent)有强因果性先验,AO可能存在陷阱。
- 在这类任务上使用AO需谨慎,需解决灵活性陷阱问题。
总结
- AO的灵活性在实践中可能构成陷阱,缩小推理边界。
- Just GRPO提供简单有效的解决方案,通过R1训练阶段使用AR顺序提升推理潜力。
- 未来方向是设计能鼓励探索的AO解码方式,进一步释放DLM潜力。