您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [国联民生证券]:计算机行业周报20260817:大模型竞相“打榜”:如何评估谁最强? - 发现报告

计算机行业周报20260817:大模型竞相“打榜”:如何评估谁最强?

报告封面

大模型竞相“打榜”:如何评估谁最强? glmszqdatemark2026年08月17日 推荐 维持评级 市场回顾 本周(08.10-08.14)沪深300指数下跌0.61%,中小板指数下跌0.63%,创业板指数上涨1.77%,计算机(中信)板块下跌0.47%。板块个股涨幅前五名分别为:兆日科技、ST易联众、春秋电子、云赛智联、数据港;跌幅前五名分别为:汇金科技、朗科科技、新开普、*ST航图、科蓝软件。 行业要闻 SpaceX600亿美元收购AI编程公司Cursor林俊旸创办语用科技,聚焦数字世界和物理世界中的下一代Agent研究DeepSeek V4 Pro正式版发布 分析师吕伟执业证书:S0590525110033邮箱:lvwei_yj@glms.com.cn 公司动态 分析师白青瑞执业证书:S0590526040005邮箱:baiqingrui@glms.com.cn 智谱:8月14日,智谱发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。相比前代,GLM-5.3的新能力包括:1)更强的编程能力,在包括Terminal Bench 3.0、Agents' Last Exam (CLI)在内的公开基准测试中取得开源第一。2)网络安全能力,在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。 投资建议 伴随开源模型与闭源模型差距持续收窄,K3 License开创的分成模式有望加速渗透,DeepSeek的涨价正式打开国内大模型量价齐升的商业化黄金期,利好开源模型公司与算力租赁厂商两大方向。建议重点关注:1)开源模型方向的智谱、MiniMax。2)算力租赁方向的宏景科技、集智股份(ARM Token工厂)、协创数据、利通电子、行云科技、智微智能、阿里巴巴、优刻得、金山云等标的。 相关研究 1.计算机行业周报20260809:大模型进入量价齐升的商业化黄金期-2026/08/092.计算机行业事件点评:AI应用弹性方向之金融与支付-2026/08/033.计算机行业事件点评:从“码农”到FDE:计算机行业重估的关键-2026/08/034.计算机行业事件点评:K3激活开源模型+云及算力租赁商业空间-2026/08/025.计算机行业周报20260801:AI主线投资重心是否向应用倾斜?-2026/08/02 风险提示:人工智能政策不及预期,行业竞争加剧。 目录 1本周观点.................................................................................................................................................................31.1近期大模型密集发布,多项评测指标成为评估关键...................................................................................................................31.2哪些Benchmark值得重点看.........................................................................................................................................................41.3 2026最新Agent Benchmark全景解读......................................................................................................................................71.4投资建议............................................................................................................................................................................................132行业新闻..............................................................................................................................................................133公司新闻..............................................................................................................................................................154本周市场回顾........................................................................................................................................................165风险提示..............................................................................................................................................................18插图目录..................................................................................................................................................................19表格目录..................................................................................................................................................................19 1本周观点 1.1近期大模型密集发布,多项评测指标成为评估关键 2026年7月中旬以来,国产语言大模型迎来了一轮密集发布潮: 7月17日,月之暗面发布新一代开源大模型Kimi K3(总参数量2.8万亿),原生搭载视觉理解、支持百万词元超长上下文,拿下Frontend Code Arena编程榜单榜首,实现开源模型首次超越头部闭源模型登顶。 7月31日,DeepSeek宣布DeepSeek-V4-Flash正式版API上线公测。据官方更新日志,正式版在Agent能力上大幅增强,多项基准测试远超预览版;模型结构、尺寸与预览版保持一致,仅重新进行了后训练。 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。 8月13日,DeepSeek-V4-Pro-0813正式版上线。Agent能力几乎全面提升,知名机构SemiAnalysis表示,DeepSeek V4 Pro和Flash在Agent相关测试中,都甩开了参数更大的英伟达Nemotron 3 Ultra模型。 8月14日,智谱正式发布新一代基座模型GLM-5.3。该模型通过后训练提高了模型的智能上限,在包括Terminal Bench 3.0、Agents' Last Exam(CLI)在内的公开基准测试中取得开源第一。 各家模型在Benchmark展示上维度不一、侧重点各异。Kimi K3分编程能力、通用智能体能力、视觉智能体能力三方面展示;DeepSeek V4 Pro聚焦Agent能力;GLM-5.3则分编程能力、网络安全、智能体综合能力三方面呈现。各家榜 单口径不一、维度各异,面对如此密集的发布与纷繁的评测数据,普通投资者和从业者难免感到困惑。那么,我们究竟应如何透过这些benchmark科学评判大模型的优劣?哪些指标最具参考价值? 1.2哪些Benchmark值得重点看 2026年初,一项发表在arXiv上的系统性研究分析了60个主流大语言模型基准,结论令人不安——近一半的基准已经饱和,即排名靠前的模型得分趋同,基准失去区分能力。因此评估一个Benchmark的重要标准就是任务真实反映实际工作场景,同时足够难,使得前沿模型得分尚未饱和,能在更宽分数区间区分前沿智能体。 工具调用与MCP编排能力重点关注Toolathlon Verified。ToolathlonVerified2026年6月发布,由中国香港科技大学自然语言处理组(HKUST-NLP)主导开发,主要评估智能体在现实环境中工具使用能力。 环境交互与计算机操作能力重点关注Terminal-Bench 3.0。2026年5月发布的Terminal-Bench 2.1评估的是AI Agent通过终端操作计算机的能力。但目前各家最优大模型在这一基准的得分均在88分左右,差距过小,区分模型的能力较差,而目前新发布的Terminal-Bench 3.0难度较高,目前GLM-5.3较GLM-5.2的分数4.有较大提升,是当前排名最高的开源模型,分数达到28.3,与其他国产开源模型拉开较大差距。 代码开发与软件工程测评是各家大模型重点关注的核心测评能力,值得重点关注的基准是DeepSWE、NL2Repo和ProgramBench。早期代码评测基准主要使用SWE-bench,通过挖掘公开GitHub仓库中的已合并修复来构建测试任务,但修复方案和讨论早已公开、可能已被纳入模型预训练数据,高分反映的可能是“记忆”而非真正的“问题解决能力”。而DeepSWE基准的任务从头编写、永不回灌上游,参考解不会出现在训练数据;并用手写验证器检验功能是否实现、接受任意正确实现。DeepSWE v1.1保留了与v1相同的长期工程任务,但通过在干净、隔离的环境中对已提交代码进行评分,更新了代理的执行和评分方式,使结果更易于重现、审计和分析。NL2Repo是评估编码智能体长周期仓库生成能力而设计的基准测试,主要考察模型的从零开始工作的能力。目前最前沿的大模型在这两项上的得分在在70分左右,未来仍然可以很好的作为区分标准。ProgramBench是Meta2026年5月推出用于衡量软件工程智能体整体性地开发软件的能力的Benchmark,目前各前沿大模型得分主要分布在10-30分,区分能力较好。 高级推理与长周期规划能力重点关注HLE w/Tools、Agents’Last Exam、AutomationBench。HLE(Humanity‘s Last Exam)是一个位于人类知识前沿的多模态基准测试,HLE w/Tools分别指的是使用工具和不适用工具,目前各前沿大模型分数在60分左右。不同于HLE考察人类知识的极限, Agents’Last Exam测试的是AI Agent干活的极限,号称“智能体最后的考试”的全新基准测试,目前各