您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:东吴传媒海外科技团队GLM-53测评与Deepseek Harness社区反馈会议纪要 - 发现报告

东吴传媒海外科技团队GLM-53测评与Deepseek Harness社区反馈会议纪要

2026-08-16 未知机构 dede
报告封面

发布时间:2026-08-16 一、核心要点 1. 本次会议为东吴证券研究所传媒互联网海外科技张良卫团队举办的机构投资者电话会议,仅代表个人观点,不构成投资建议,围绕GLM-53一线测评与Deepseek Harness社区反馈展开。 2. GLM-53于2026年8月14日正式发布,此前8月3日官网短暂上线后下线,基座延续GLM-5的743/744B参数、40B激活规模,上下文窗口100万,核心变化为强制启用仅高低/Max档位的思考模式,无关闭选项。 3. GLM-53实测表现:长任务能力大幅提升,短查询/短上下文场景弱于GLM-5.2;编程基准长任务指标优于GLM-5.2,接近GPT-5.6 Pro;网络安全场景获第一方高分,曾通过漏洞路径读取未授权数据,漏洞发现能力较强。 4. GLM-53思维链效率大幅提升,思考相关Token从GLM-5.2的8k左右降至2.5k左右,减少无效思考,提升指令遵从与长任务注意力保持能力,效果接近GPT-4.8;700多B参数规模下性价比高,特定范围内无明显对手,仅专业外知识存短板。 5. Deepseek Harness为开源内测项目,核心架构为“一切皆插件”,初期不完善,后续插件数量增多,具动态能力扩展特性,可在任务运行中加装工具、会话、循环逻辑等底层组件的插拔式插件,打破模型制备器单一固定模式,创新价值较高。 6. 国内大模型已形成差异化:Deepseek在AI基础设施优化效率、成本上全球领先;GLM在幻觉控制、超长任务稳定性上保持高水准;某模型在前端Web、视觉研发上具优势。 7. 第三方Agent底座为行业现实格局,主流做法是平衡优化多数模型,目标多数模型达8分以上,热门模型达95分左右;GLM-53在较小参数下达国内头部水平,前期回调后值得关注,期待后续预训练及参数量扩大后的智能水平提升。二、社区反馈 1. Deepseek Harness社区反馈呈两极分化:非技术用户认为上手难度高、基础能力弱;技术人员认可其动态能力框架的行业价值,但存在默认配置基准测试结果缩水问题,第三方调整环境后可复现官方基准水平。三、风险与关注 1. GLM-53需平衡指令遵循与灵活性,其指令遵循能力较前代(GLM-5.1/5.2)显著提升,工具调用、按要求格式化输出等表现进步,逻辑抗干扰能力强于GPT,但存在过度遵从错误指令、灵活性受影响的潜在问题,场景适配性需关注。 2. Deepseek Harness为行业提供新方向,但具双刃剑效应:强依赖社区插件,插件可靠性、可用性待解决,官方倾向半官方属性的社区运营,需介入认证、激励插件验证;运营不足易导致社区分层,仅技术用户参与,生态扩张受限;该项目开源值得尊重,但未看出商业化追求,C端友好但B端使用因可控性不足需谨慎,不过其构建的智能体(Agent)范式是长期核心潜力方向。