国联证券研报指出,GLM-5.3模型在编码能力方面取得显著提升,成为Coding领域的领先者。此次能力提升主要源于后训练Scaling,通过大幅扩展长程任务环境、环境类型和训练时长,模型在未扩大基座模型规模的情况下仍实现明显进步,表明现有基座模型的智能潜力仍有充分挖掘空间。
核心数据及表现:
- 编程体感提升:GLM-5.3编程体感相比GLM-5.2提升约50%。
- Terminal-Bench3.0测试:得分从GLM-5.1的5.1提升至28.3(K3为17.4),反映真实终端复杂任务执行能力大幅增强。
- DeepE测试:在长程软件工程任务上,得分从46.2提升至66.9(K3为67.5),表现突出。
研究结论:
GLM-5.3在编码领域的表现超越Mythos,成为该领域的领先者。后训练Scaling技术验证了现有基座模型的智能上限仍有较大提升空间,编码能力成为当前模型能力提升的最核心方向。模型在长程任务和真实终端环境中的表现均显著优于前代版本。