智谱今日正式发布GLM-5.3:#本次能力提升几乎全部来自后训练Scaling,在基座模型没有继续扩大的情况下,靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。 三点看: 1️⃣Coding仍是核心主线→编程体感较5.2提升约50%。Terminal-Bench3.0从5.1升至28.3(K3为17.4),GDPval-AAv2达1769(K3为1682),Agents'LastExam28.5微超K3的27.6;DeepSWE66.9与K3的67.5基本打平。GLM-5.3已站上开源模型Coding/Agent最头部梯队、#整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。 2️⃣意外变化:网络安全能力"涌现"→随Coding与长程Agent能力增强,代码审计、漏洞发现与漏洞推理显著提升:#CyberGym得分居全球第一(84.5>Mythos5:83.8),白盒漏洞发现接近Mythos5/GPT-5.6Sol;发布前两周与国内多家安全团队合作测试,累计发现2400+漏洞、其中1000+为中高危。#Coding能力提升后、模型正自然延伸到更复杂的专业Agent场景。 3️⃣路径与商业化→再次验证Coding→Agent演进:模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。GLM-5.3同步上线ZCode、AutoClaw与GLMCodingPlan,已接入多家外部Coding/Agent平台,API即将上线;#模型权重将在两周安全评估与加固完成后正式开源。 落点:#智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场,这延续了我们的判断(DS与Grok同样如此),同代际能力趋同后,竞争继续转向复杂长程任务的执行质量、推理效率与成本,现有基座模型的智能上界、仍有充分的挖掘空间。Barry