这次能力提升几乎全部来自后训练Scaling 这次大幅扩展了长程任务环境、环境类型和训练时长,在没有继续扩大基座模型的情况下,模型能力还能明显提升。某种程度上说明,现有基座模型的智能上界还有充分的挖掘空间。 Coding仍然是这次最核心的能力提升,也是目前最重要的模型能力方向GLM-5.3编程体感相比5.2提升约50%。在衡量模型真实终端复杂任务执行能力的Terminal-Bench3.0中,得分从5.1提升至28.3(K3为17.4);在聚焦长程软件工程任务的DeepE上,从46.2提升至66.9(K3为67.5);在Agents'LastExam上,从23.8提升至28.5(K3为27.6)。在覆盖44种职业、考察真实高价值知识工作的GDPval-AAv2中,GLM-5.3得分达到1769(K3为1682),展现出伴随编程能力提升而出现的更强专业任务执行能力。在衡量AIAgent真实软件漏洞分析与复现能力的CyberGym上,GLM-5.3得分84.5,高居全球第一(Mythos5为83.8),体现出Coding能力向网络安全等复杂专业任务的进一步延伸。目前GLM-5.3在多个Coding/Agentbenchmark上已经处于开源模型最头部梯队,整体能力接近最前沿闭源模型。更重要的是,这次提升主要体现在长程、复杂的软件工程与任务执行能力,而不是简单写代码或做Demo。 网络安全能力“涌现”超mythos 随着Coding和长程Agent能力增强,模型在代码审计、漏洞发现和漏洞推理上的能力也显著提升。在白盒漏洞发现等任务上,GLM-5.3已经接近Mythos5/GPT-5.6Sol这样的前沿闭源模型。发布前两周与国内多家安全团队合作测试中,累计发现了2,400+个漏洞,其中1,000+个为中高危。这说明Coding能力提升之后,模型能够自然延伸到更复杂的专业Agent场景。 从模型演进路径来看,这次发布也进一步验证了公司一直强调的逻辑:Coding→Agent模型不再只是回答一个问题或者完成一段代码,而是开始能够在数万行代码、上百个文件、多个工具和系统之间持续工作,自己分析、执行、验证和完成任务。这是Coding模型向真正可工作的Agent演进的重要一步。 产品和商业化层面也会同步推进 GLM-5.3会直接上线ZCode、AutoClaw和GLMCodingPlan,并已经接入多家外部 Coding/Agent平台;API很快上线。模型权重会在两周安全评估和加固完成后正式开源。联系人:国联民生计算机吕伟/白青瑞