🌟模型能力提升,是以数据为燃料,预训练基座为大脑,#后训练为行动 。Agentic时代,#后训练的重要性被提高。 🌟智谱GLM-5.3延续5.2约700B的基座,继续靠强化后训练,已经能做到接近K3 2.8T大基座的水平,说明#智谱后训练能力在国产模型中的领先性。 🌟重温一下后训练仙人智谱 的后训练代表算法——#26年7月发表的SAO。SAO本质上升级了DeepSeek-R1的GRPO算法,#顺应了Agentic时代的长/复杂推理,让不同长短的答案,在生成之后直接去做RL,并且辅以过时答案的过滤等机制,效果显著。 🌟更有意思的是,SAO这种“一条经验回来就能学”的方式,天然更接近让Agent边干活、边学习、持续进化,也#为后续的continue_learning打下了基础。如果这条路最终跑通,后训练的意义还会再上一个台阶:#模型发布可能不再是一个静态终点,#而是持续学习的起点。 🌟近期ox-alpha新模型的测试也是大家的关注点,有些公开探讨说是智谱的新模型,#这个目前还没有定论,不做评判。 From ☎️华泰计算机 郭雅丽/范昳蕊/袁泽世(15850794285)/岳铂雄/王浩天/徐诚伟