[太阳]事件:8月14日,智谱正式发布GLM-5.3。与GLM-5.2相比,GLM-5.3沿用相同基座模型,能力提升主要来自后训练Scaling,在多项Coding及Agent公开评测中取得开源第一,编程体感较GLM-5.2提升约50%,并涌现出接近全球前沿闭源模型的网络安全能力。 [玫瑰]同一基座模型实现能力跃升,进一步验证后训练Scaling仍有较大空间。本轮升级没有继续扩大基座模型规模,而是将长程任务环境扩展数十倍,同时增加环境类型和后训练时长,并依托IndexShare、SAO及新一代Slime框架提高强化学习效率。我们认为,这意味着模型能力提升并不完全依赖参数规模和预训练算力扩张,通过持续增加高质量任务环境、长程轨迹和可验证奖励,现有基座模型的智能上界仍可被进一步挖掘,也有助于公司以更高的资本和算力效率推进模型迭代。 [玫瑰]Coding仍是GLM-5.3本次最核心的能力提升方向,从几个最具代表性的长程Coding及Agent评测看: 1)在DeepSWE v1.1上,GLM-5.3得分由46.2提升至66.9,基本追平Kimi K3的67.5,高于Grok 4.6官方披露的65.9和DeepSeek V4 Pro的62.7; 2)在Agents’ Last Exam上,GLM-5.3由23.8提升至28.5,高于Kimi K3的28.3和DeepSeek V4 Pro的25.7 3)在难度更高的Terminal-Bench 3.0上,GLM-5.3由4.6大幅提升至28.3,较Kimi K3的17.4高出10.9分、领先约63%,同时超过Grok 4.6的最新公开成绩26.5。整体来看,GLM-5.3在各项能力上已经达到开源模型的顶级水平。 [玫瑰]真实编程体感与Token效率同步提升,模型正在由“写代码”走向“完成工程任务”。GLM-5.3每项任务平均输出约5万Tokens,而Opus 4.8约需12万Tokens。GLM-5.3不仅任务通过率更高,执行路径也更短,体现出更强的规划、工具调用、自主验证和错误修正能力。 [玫瑰]网络安全能力显著涌现,为Coding向高价值专业Agent延伸提供了代表性场景。在 白盒漏洞发现任务CyberGym上,GLM-5.3得分由77.2%提升至84.5%,高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。在ExploitGym中,两小时和六小时分别完成105项和130项任务,较GLM-5.2的29项和39项大幅提升。虽然模型在完整漏洞利用链条上与Mythos 5等闭源模型仍有差距,但在代码审查、漏洞识别和验证等更偏防御端的任务上已经达到全球前沿水平。 [太阳]综合来看:1)相同基座模型通过后训练Scaling仍可实现显著能力跃升,现有模型的智能上界尚未被充分挖掘;2)Coding能力正在由代码生成升级为长程工程任务交付,模型开始具备真正可工作的Agent形态;3)Coding能力增强可以自然延伸至网络安全等高价值专业场景,打开新的商业化空间。随着GLM-5.3在自有产品、外部Coding平台和开源生态中加速落地,持续看好智谱在国产基础模型、Coding Agent及专业Agent领域的领先卡位与商业化弹性。