大模型幂律定律,也就是我们常说的Scaling Law,是大模型领域非常核心的一个规律。简单来说,它描述了模型性能和模型规模(比如参数量)、数据集大小以及计算量之间的一种特殊关系——幂律关系。
具体点讲,就是当模型的参数量、训练数据量或者计算量增加时,模型的性能(通常用损失函数来衡量,损失越低性能越好)会按照幂律的规律得到提升。但这也意味着,随着这些因素的不断增加,性能提升的幅度会逐渐减小,也就是边际回报会递减。比如,你把参数量从10亿增加到100亿,性能提升可能很明显,但再从1000亿增加到1万亿,提升效果可能就没那么显著了 【1】 【2】 。
这个定律是OpenAI在2020年提出来的,它指出,为了获得最佳性能,模型参数量、数据集大小和计算量这三个因素最好能同时放大。而且,当不受其他两个因素制约时,模型性能与每个单独因素都呈现幂律关系 【3】 。这一定律非常有用,因为它能帮助我们预测模型性能,指导我们怎么分配资源,比如在计算量有限时,是该优先增加参数量还是数据量 【3】 【5】 。
不过,这里面还有些细节。比如,OpenAI和DeepMind对于计算量增加时,参数量和数据量该如何分配就有不同看法。OpenAI认为参数量更重要一点,每增加10倍计算量,参数量约增加5.5倍,数据量约增加1.8倍;而DeepMind则认为两者应该同步增加,都是约3.16倍 【4】 。
另外,幂律定律还告诉我们,模型性能的提升是平滑且可预测的。我们可以从小模型的实验中拟合出规律,来预测大模型的表现 【7】 。而且,这个定律不仅适用于语言模型,在其他模态和跨模态任务上也适用 【6】 。
当然啦,虽然幂律定律很重要,但它也不是万能的。比如模型的一些涌现能力(像少样本学习这种),就没法完全用幂律定律来准确预测,这些能力可能在模型达到某个规模阈值后突然出现 【9】 【12】 。而且,大家也在探索这个定律的极限在哪里,目前普遍还是希望我们还处于“正常的Scaling”时期,离“能力天花板”还远着呢 【1】 。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803