00:22:56 哎,白老师,我现在要不在共享屏幕,你看一下我这边共享屏幕是否OK好。是OK的吗?没问题,好嘞,嗯。 00:24:32 好,大家上午好,这里是智源社区直播间。今天是智源talk的第369期。呃,我们今天邀请到清华大学倪赞林给大家做今天的分享。今天的分享分为前面的主题报告以及后面有一些QA环节。大家如果有相关问题可以把你的问题写在评论区。呃,我们请暂停,后续给大家做一个解答。好,那我要不就开始,好,嗯,好好,谢谢主持人。呃,今天也很荣幸能来到志远社区分享我们关于Diffusion模型的最新工作,以及一些相关的思考啊,我们的论文题目叫the flexibility trap rethinking the value of arbitrary order in diffusionlanguage models.这篇论文也很荣幸获得SML杰出论文奖。 00:25:25 在过去几年里,占主导地位的这个language modeling的方案一直是next token prediction,像C h a t G P T、D e e p S e e k还有Claude Gemini这些模型都是采用这样一套生成的范式。那么他们往往是解码的时候一次生成一个token,严格的从左到右解码的过程是顺序进行的,而且这个顺序也是固定的。 00:25:50 最近呢,一种被称为扩散大语言模型diffusion large language models简称DLM的新范式,正如这张呃右边的GF所示,通过任意顺序的对这种呃corrupted mask token去进行去噪,打破了上述两个约束,这带来了两个重要特性,第一个是并行解码paralleldecoding,第二个是任意顺序arbitrary order. 00:26:20 先说并行解码模型,不是每一步只产生一个token,而是像这个动画里那样每一次解码多个位置,这是一个直接的效率提升,它价值呢也呃得到这种充分的领域里面里面的确认。 00:26:36 像最近的一些嗯商用的这种diffusion language模型,比如说像mercury,还有像之前Google的这种呃。做过的diffusion language模型,比如说Gemini diffusion,还有之前的这个see的那边有一个叫seed diffusion,这些工作其实都是。把这种效率优势。诶,不好意思,我呃。把效率优势给呃优化到极致,然后呢, 00:27:07 第二个特性是。任意顺序可以看到模型这个时候生成过程不是一个严格的从左到右,它可以按自己喜欢的任意顺序来填充这个序列。而我们认为呢,这个任意顺序它的灵活性值得更仔细的一个审视。这种灵活性在直觉上它有一个很大的好处, 00:27:29 具体来讲呢,就是一个任意顺序的模型,它既然可以自由选择任何的生成顺序,那么这个时候呢,我们传统的从左到右顺序,只是它其中可有所有可选项的一种特定的选择。那相比来讲呢,自回归的LM就只能从从左到右的顺序进行解码,因此呢,任意顺序的轨迹集合,严格地把唯一的从左到右轨迹作为一个特例包含在内。而更大的这种路径集合呢,也应当意味着模型能够到达更多的解。 00:28:04 所以简而言之呢,更灵活的这种解码顺序理应扩大推理边界,这就是我们这个图里面所示的这样一个intuition。那么这个是他承诺的一个这种promise的前景, 00:28:19 但是在实践中我们想问这种灵活性真的扩大了模型的推理边界吗? 00:28:26 那么要回答这个问题呢,我们需要一种衡量模型推理边界的办法。我们沿用了近期的工作,用Passat k作为代理指标。这个思路很简单,就是对模型采样K次,只要其中有一次正确就算成功。那么随着K增大呢?Passat k基本上就反映了模型推理边界所能触及的范围,也就是在足够多次尝试下,它能答对的一切有了这个指标,我们对同一个扩散模型ladainstruct只改变解码顺序,画出了它的passage k曲线。在K=1,也就是单次生成的情况下,两种顺序基本持平,任意顺序还能略微领先于自回归顺序,到这里为止,灵活性表 现得不错。 00:29:13 但随着K增大,有意思的事情发生,自回归顺序开始拉开差距,在曲线的中段,二者的差距逐渐打开。等到K=128的时候,自回归顺序明显更高,任意顺序则停在一个更低的上限上。这是一个反直觉的观察,因为任意顺序反而带来了更低的推理边界。而且这并不是在某一个设定下的特例,在3个扩散模型以及4个横跨数学和代码的推理基准上,结论都是一样的。在Pat k这个指标上,自回归顺序似乎始终扩展得更好。 00:29:55 现在我们回到那个一开始提到的superset超级这个直觉,左边是我们期望的情形,任意顺序理应包含自回归顺序所能解决的一切,甚至更多。而右边呢,则是我们实际观察到的情形,我们用pass11024测量了可实现的解的集合,只有任意顺序能解出的题其实非常少,远低于1%。 00:30:20 可以看这里面的非常非常小的这个蓝色的月牙,几乎可能看不太清清楚,而自回归顺序只有自回归顺序能解出的问题则要多得多。可以看这里面的橙色的月牙。因此呢,嗯,在实践中,其实任意顺序它可达到的解的集合其实反而是更小而不是更大。因此呢,直觉上我们认为。自回归顺序可解的是auto regressive的超级,但实践却恰恰相反。 00:30:55 那么为什么会发生这样的情况呢?我们把它归因于两种顺序处理不确定的方式。先看AR顺序,它一次一次解一个一个token的推进序列。当遇到一个高不确不确定的token,也就是推理可能分叉的地方时,他必须当场做出决定,而手上只有前面的上下文。这恰恰就是各种分叉可能性被实现出来的时刻。 00:31:19 我们可以看下方的entropy的这样一个视图,这个token是在高熵状态下被解码的,那这个时候它的各个分支仍然保持开放。换言之,当我们让模型在这里面做多次尝试的时候,可能一次走这个分支,一次可能会走这个分支,一次可能会走这个分支,这个时候它的entropy就是一种。对他多个分支仍然保持开放,有可能去探索到的一个呃反应。 00:31:49 那么相比较而言呢,在任意顺序里,这种灵活性通常是采用一种先易后难的方式去被利用的,就是一种基于置信度的启发式方式,它呢倾向于绕过这种难的token,而先把容易的token去定下来。但等到他回来再去填补那个被跳过的token时。我们可以看到。既定的后续上下文早已划掉了它原本可能选择的其他分支,因为这个时候呢,我们的后面的上下文被established得更多,所以这个时候自然而然回去解这个token的时候,它变得更简单了。 00:32:34 但是呢,这个时候虽然这个token看起来变得更容易,实际上它的熵早已发生坍缩,而而其所蕴含的其他的分支也已经关闭。所以本质上有两件事情同时发生了,基于置信度的这个解码方式绕开了不确定的token,而过早的固定上下文又使这些不确定的token的熵坍缩,于是推理路径变少,可达到的边界也变小。这就是我们所谓的the flexibility trap灵活性陷阱,采用任意顺序的这种自由性或者说特权,最终却恰恰避开了那些推理探索所依赖的那些关键的token。 00:33:20 为什么这一点如此重要呢?因为它直接损害了R1后训练,而后者呢,恰恰是本质上把推理潜力,也就是Passat k转化成真正的推理表现,也就是passy one的核心工具。 00:33:35 已有工作表明,这种R1 VR,也就是可验证奖励的强化学习,主要是在强化模型本来就能采样到的一些正确答案,它是在锐化这个可达的集合,而不是加入本质上全新的东西。 00:33:50 现在我们用这个视角来看两种顺序。在AR顺序下,模型可以正面处理那些不确定的token,因此它的分支保持开放。正如绿色箭头所示,每一条存活下来的分支都是一条RL可能可以奖励的,并且强化的推理路径。而在任意顺序下,不确定的token被绕开,它的分支被划掉,留下的这种轨迹也更少,R1能用的原材料也就更少。因此,本质上,任意顺序恰恰缩小了R1后训练所依赖的那些推理轨迹。 00:34:26 这引向了一个非常直接的想法,如果我们仅仅在RL post training阶段干脆回到原来的自回归顺序会怎么样? 00:34:37 为了说明这一点为什么是有吸引力的,我们可以把两种顺序并排进行比较。以往基于任意顺序的RL算法起点是有更低的这个推理潜力,因为边界更窄,而且他们带来的RL探索也更弱,因为可强化的东西更少,而且呢,他们还需要专门的机制,比如说像elbbo近似来处理这种难以计算的似然。而右边的自回归顺序则把这三点都反过来,推理潜力更高,探索也更好,似然也变得更加精确且能跟这个index对齐。因此呢,在这种情况下。你不仅获得了更好的这种reasoning potential和RL exploration,更重要的是你可以采用更直接、更简单以及成熟的这种方案,比如说像标准GRPO算法来进行强化学习。 00:35:32 我们把它称之为GR just GRPO算法,这个我们的方法它确实就像名字所暗示的那样简单。在RL库训练中,以往的方法和以前一样,只会去解码置信度最高的token。而我们呢则只是把这个rlpos training阶段改用自回归顺序,然后每一步只解码最左边的mask token,这就把扩散语言模型变成了一个自回归策略。然后呢,我们就能跳套用最朴素标准的GRPO算法,这里面不存在新的损失函数,没有也没有设计新的架构,也没有设计特殊的这种技巧,只是GR RPO算法。 00:36:16 有一个特殊的呃,有一个重要的设计要点值得一提,我们的改动只限定在R1的后训练阶段,其他的阶段则完全保持不变,尤其是在推理阶段,我们只需要切回任意顺序的并行解码,这样我们就兼得了两方面的优势。第一点,借助简单的GRPO算法,在R1训练阶段,我们可以获得更好的探索以及更简单的实现。在第二方面呢?推理时我们保留了并行解码的速度,而这正是扩散模型一开始最吸引人的地方。自回归顺序只是R1训练阶段的一个选择,推理速度并不受影响。 00:36:58 这张表把just GRPO与近期专门用于扩散语言模型的RL算法进行了对比,标准的GRPO算法,呃,GRPO的这样一个objective就取得了很强的表现,比如在GSM 8K上达到89.1的水平,而完全不需要任何呃任意顺序所独有的那些相对复杂的设计。 00:37:22 现在我们再看推理这一侧,这些曲线画的是随着每步解码更多token,准确率该如何变 化。所以向右意味着更高的并行度、更快的速度。经过Just grrpo训练后的模型在各处都高于基座模型。更有意思的是,随着我们把并行度推得更高,这个差距实际上还在扩大,在MBPP上高达25%,并且解码能力被完整保留下来,甚至还略有增强。 00:37:50 最后呢,我们这个工作将会走向何方?我们的洞见开启了两条互补的方向,我们采取的是第一条是彻底避开这个陷阱,Just GRPO只是在RL阶段退回到AR顺序,它简单有效,并且可以跟任何标准的GRPO流程兼容。所以呢,今天我们就能用上这样的训练方法。但是同样的insight也指向第二条可能更有雄心的方向,就是我们有没有可能从源头上去修复这个陷阱。 00:38:20 与其用一个纯粹基于置信度的规则,我们或许可以考虑设计一种任意顺序解码的方式,并且让它主动鼓励探索,并在不确定的token上让这种分支和可能性保持存活。这样呢,我们就可以在完整保留灵活性的同时,兑现推理上的优收益。 00:38:42 所以呢,总结来看,我们今天有了一个强大而实用的方法,而前方又有一个令人兴奋的道路,可能会进一步释放扩散语言模型的潜力。 00:38:54 所以总结一下,第一点,任意顺序可能是推理阶段的一个陷阱,它悄悄缩窄了RL所能激发出来的东