- 核心观点:智谱AI发布的GLM5.3模型通过大幅扩展任务环境和训练时长实现显著能力提升,预训练参数未扩大情况下模型性能明显增强,预计后续结合预训练参数扩大将实现更强智能水平。
- 关键数据:
- 编程体感相比GLM5.2提升约60%。
- 在terminalBench2.0、Agents'LastExam等benchmark中超越K3,DeepE与K3相当。
- 在真实软件漏洞分析的CyberGym中超越Mythos5。
- 研究结论:
- GLM5.3的coding能力稳居国内第一梯队,接近Fable5水平。
- 后训练持续scaling策略有效提升模型专业任务执行能力。