该研报深入探讨了模型缩放定律的演变历程,从早期Kaplan等(2020)提出的参数增长应快于数据(约2.7:1)的理论,到Hoffmann等(2022)通过实验修正为最优比例约为每个参数20个token,并指出万亿参数阶段是行业弯路。报告分析了Chinchilla模型对单次训练计算的优化及其局限性,以及当前最优实践如Llama-2-7B和Gemma-2-9B通过过度训练实现的小参数高效模型趋势。此外,还探讨了稀疏性在MoE模型中对目标函数的影响,以及总参数与推理能力间非固定比例关系。最后,以GLM-5.3为例,验证了模型缩放需多维度协同优化的观点。
AI模型缩放赛道正从盲目追求超大参数转向精细化优化。早期以GPT-3为代表的超大模型构建虽推动了技术发展,但Hoffmann等(2022)的研究已明确指出其并非最优路径。当前趋势表现为:1)小参数高效模型兴起,如Llama-2-7B和Gemma-2-9B通过刻意过度训练实现高性能;2)稀疏性技术改变目标函数,MoE模型中总参数与激活参数无固定比例,需根据任务调整;3)长推理链能力成为关键,总参数存在阈值效应,需结合长时域环境和RL缩放优化。未来,模型缩放将更注重多维度协同,包括基模型大小、预训练数据、前向计算等独立调整。
研报重点分析了模型缩放定律的三个核心方向:1)参数与数据比例的演变,从早期2.7:1的误区到20:1的修正,以及万亿参数阶段的反思;2)推理主导的长期成本,Chinchilla模型的局限性与当前小参数高效模型的实践;3)稀疏性对MoE模型的影响,总参数与激活参数的非固定比例关系及任务依赖性。此外,报告还通过GLM-5.3案例验证了多维度协同优化的必要性,揭示了模型缩放并非单一旋钮操作。
当前AI模型市场呈现多元化发展格局,早期超大参数模型的盲目扩张已被修正,行业正转向精细化缩放。一方面,小参数高效模型如Llama-2-7B和Gemma-2-9B通过过度训练实现高性能,表明推理需求推动模型向更小但更深入的方向发展;另一方面,MoE模型中总参数与激活参数的非固定比例关系,以及长推理链能力的阈值效应,为市场提供了新的优化空间。GLM-5.3的案例进一步证明,模型缩放需结合长时域环境和RL缩放等多维度协同优化,而非单一参数调整。
该研报提示模型缩放存在三大风险:1)参数规模盲目扩张的路径依赖,如万亿参数阶段被证实是行业弯路,可能导致资源浪费;2)单一维度优化忽视长期成本,Chinchilla模型未考虑推理主导的长期成本,当前小参数模型虽高效但过度训练可能引发稳定性问题;3)多维度协同优化的复杂性,基模型大小、预训练数据、前向计算等需独立调整,但实际操作中可能因未完成缩放阶段涉及中训练、预训练等更多维度而增加不确定性。