智谱今日发布GLM-5.3模型,核心能力提升主要依靠后训练Scaling,基座模型未扩大规模,通过扩展长程任务环境、环境类型与训练时长实现明显提升。主要提升体现在以下三个方面:
- Coding能力显著增强:编程体感较GLM-5.2提升约50%。
- 编程评测成绩优异:Terminal-Bench3.0从GLM-5.1的5.1升至28.3(K3为17.4),GDPval-AAv2达1769(K3为1682),Agents'LastExam28.5微超K3的27.6,DeepSWE66.9与K3的67.5基本打平。
- 网络安全能力意外涌现。
GLM-5.3已站上开源模型能力SOTA(State-of-the-Art)水平。