您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 未知机构:《国金金融工程GLM-5.3及GLM-5.3-Flash金融投研能力评测》-发现报告

国金金融工程GLM-5.3及GLM-5.3-Flash金融投研能力评测

2026-08-30 未知机构 ShenLM
报告封面

一、AI总结内容 一、核心要点 1. 智谱于2026年8月14日发布GLM-5.3,8月26日发布GLM-5.3-Flash :GLM-5.3采用与5.2相同架构底座,原生支持100万上下文token,仅处理文本,主要提升长城工程、工具执行能力;GLM-5.3-Flash为GLM系列首个原生多模态底座,参数320B、激活18B,支持文本、图像、视频,突出工具编排、自动化能力 2. 模型能力对比:GLM-5.3深度推理、安全能力提升,在公开Agent榜单评分略高于DeepSeek-V4 Pro;GLM-5.3-Flash多模态原生,与DeepSeek-V4 3. API价格:GLM-5.3价格无变动,缓存命中2元/百万token、未命中8元/百万token;GLM-5.3-Flash缓存命中0.23元/百万token、输入0.8元/百万token、输出2.8元/百万token,原价为GLM-5.3的1/10,限时五折后为1/20,未命中场景性价比高,缓存命中场景略高于DeepSeek-V4 Flash 二、金融投研实测表现 1. 估值任务:以中际旭创为研究对象,GLM-5.3可完成财报拆解、三表与估值模型联动,交付完整可重算的投资分析报告,表现排第一;GLM-5.3-Flash三表现金关系简化,DCE终止权重偏高,表现排第二;DeepSeek-V4 Pro、Flash及Kimi K3依次排名后 2. 回测任务:以沪深300成分股因子回测为核心,GLM-5.3数据链完整,但存在收益取错、交易时点未严格处理的逻辑问题;GLM-5.3-Flash底稿质量降低,细节调仓日期有出入,二者均排中等;DeepSeek-V4 Pro排第一,V4 Flash排第二 3. 行业研究任务:以半导体设备产业链为对象,GLM-5.3、5.3-Flash覆盖公司和数据广但存在微弱幻觉;DeepSeek-V4 Pro排第一,GLM-5.3排第二,5.3-Flash排第三,V4 Flash排第四,Kimi K3表现最差 三、结论与风险关注 1. 结论:GLM-5.3适合资料检索、结构化取数、研究底稿生成,细节处理弱于DeepSeek-V4 Pro;GLM-5.3-Flash在未命中缓存场景性价比高,是核心推荐的多模态投研工具 2. 关注:GLM-5.3-Flash本地部署优化不足,需资源量为DeepSeek-V4 Flash的1.5倍;部分任务存在幻觉、交易逻辑漏洞等问题,需人工校验 二、音频原文(转写) 大家好,欢迎参加国金金融工程glm-5.3与glm-5.3- flash金融投研能力评测。目前所有参会者均处于静音状态下面开始播报声明本次电话会议仅面向国金证券的专业投资机构,客户或树邀客户仅供交流研究观点。专家发言内容仅代表其个人观点,会议内容并不构成对任何人的投资建议,未经国金证券事先书面许可,任何机构或个人严禁以任何形式将会议内容和相关信息对外公布转发转载传播复制编辑修改。 解读等涉嫌违反上述情形的,我们将保留一切法律权利。感谢您的理解和支持。谢谢好各位领导大家呃,早上 好我,我是国金精工研究员陶洋,我今天给大家主要分享一下就是最新的这个gm5.3和5.3 flash,它接连发布,然后我们去看一下它的一些这个能力的提升,包括呃像一些价格方面以及一些其他的一些情况,然后包括在金融投研方面的话,我们也是在这个个股估值,然后回测编写,然后以及这个呃行业的研究这一方面去做一些评测。 啊,看一下它跟deepseek的一些模型,包括接呃k米k3的模型的一个差距或者说。这个水平的一个比较。呃,那首先的话就是还是介绍一下呃gm5.3和5.3 flash的一个基基本情况,那是呃8月14日的话,质朴是发布了gm5.3啊,然后也是同步的这个api上线,然后12天之后8月26号就智普,又再次发布了g m5.3 flash。那呃55.3的话呢? 它其实还是采用跟5.2相同的这个架构和底座。呃官方对这一代的这个口径是744啊呃b然后单token,激活大概是40b的这样一个大模型。它原生是支持100万上下文的一个tokenapi。输出的最大输出的话是128k,但是gm5.3,它其实是只能处理文本的啊,它它的相对于这个gm5.2的改进呢,本本质上是在这个利用一些呃更多的一些数据。 做一些后训练啊,所以在可能复杂编程终端操作和长城agent上面会稍微有一些提升。但5.3 flash,虽然说它是在5.3的基础上加了1个flash这样一个呃编号啊,但实实际上它是另外一条线,就是它是gm5系列首个原生多模多模态的这样一个底座,所以就模型的底座也是跟这样5.3是不一样的,它总的参数是320b,然后激活。我只有18b原生的话是支持文本图像和视频啊,所以它整体上是我们认为是呃,可以说是质朴比较新的一个多模态大模型。 呃,然后他也引入了所谓的流行约束超连接和index破,然后预训练语料大概是30t的token。相较于这个歼五点,三官方的说法是这个注意力计算量和k v catch降低到了这个1/3和1/4.4。目标的话就是在保用保留可用智能的同时,压低这个上下文视觉闭环和日常a技能的边际推理开销。那在模型能力方面的话,我们呃觉得就是说gm5.3和5.3 flash相对于gm5.2的提升主要呢,都集集中在这个长城的工程和工具执行上。 然后他并不是把已经很高的这个tom bench2.1在抬在有所抬升。呃5.3主要在这个deeps.W.E这样一个项目上,从46.2提升到66.9呃,大概是40%的一个涨幅,然后automation bench,然后也是从26.2提升到48.2,整体上提升了84.0%。嗯,可以看到就是整体上它,呃也是在这个长城工工程和工具执行以及ag的能力方面。啊,会有一个比较明显的提升那5.3 flash同样也是明显在这几个方面去强于这个5.2的。 啊,我们主要认为就是这两款的改进呢,相对于像5.2的话呢,都是在agent的执行短板,这一块进行了一个补足啊,5.3的话,呃相对来说更加完整的去拉高了深度推理和安全方面的能力,然后5 flash的话,更多的突出在是工具编排还有这个自动化这这样一方面的一个能力。呃与这个deepseekv4,我们也是做了一个比较详细的对比,呃,我们认为在呃他们共同发布的这样一个公开agent的榜单上5.3相呃gm5.3相对于deepseekv4 pro啊,整体上是处于同一梯队的,然后呃大概有60%的。 这样一个评分是略高于deepseekv4的。嗯,然后像比如说像hle,它其实是62.5,然后v4 pro是60.0,然后像deep到sw是66.9,相对于这个v4 pro的62.7。啊,所以整体上是有一个细微呃,呃,有一有一点点领先。呃质朴的话,它呃在哈尼斯方面的话是采取这个卡扣的哈尼斯的这样一套模板,但deepseek的它有它的一个优势的话呢,是采用自研的这样一个哈尼斯工具啊。 啊,所以在这方面他其实是不太可比的啊。呃综合两张表的话,我们认为就是五点,三是相对来说更加稳健的1个旗舰执行模型,然后呃5.3 flash,我们去跟v4 flash对比的话啊,整体的一个呃各项评分其实也是在呃70%左右的这样一个评分项目上是略微高于v这个deepseekv4。是法学的。啊,所以我们认为在整体能力上可能说gm,g,mglm的5.3系列,相当于dpcv4的这个系列啊,可能会更加稳健1些。 呃,然后在api价格方面的话,呃,我们也发现就是g m5.3 flash啊,它在未命中的情况下,其实呃是达到了一个非常高的一个性价比啊,相对于deepseekv4 flash,它的这个性价比啊是更高的。呃,在我们。呃,它的这个5.3的定价呢其实是没有相对五点,二没有改变啊,同样是缓存命中2元未命中这个是8元,输出的话是28元每100万token。呃,然后5.3 flash的话,它的这个未命中价格其实会便宜一个数量级啊,就是在呃缓存命中的时候呢,是0.23元,然后输入是0.8元,输出是呃2.8元。 整体上是5.3的1/10的价格,然后最近的话也有这个限时五折,所以整体上是2分1/20的一个5.3的价格。嗯但是呃,值得注意的是,就是因为5.3 flash,它是呃,这个价格其实是未命中价格,但如果说我们在一些长期的使用过程中啊,可能会更加常用的用到了这种呃命中缓存的这样1种场景,在命中缓存场景下的话,其实5.3 flash的价格啊是相对于这个deepseekv4 pro啊v4 flash的价格是相对更高一点,但嗯整体上我们认为就是g m5.3 flash,它的这个性价比啊,至少说可以跟这个v flash是呃。 就是在未命中的情况下其实是呃更更低的,然后呃在命中的情况下呢可能略高于这个呃deepseekv4flash的这样一个价格。呃,另外的话就是deepseek呃,另另外的话就是这样5.3 flash的话,它呃其实也是嗯往一个中小规模这样呃这样一个激活状态去做啊,所以它嗯,理论上也是满足呃,我们去利用一些本地的显卡去做本地部署的这样一个需求,呃,因为他也是有一个呃相对这个旗舰版模型更小的这样一个参数量呃,但是我们认为就是g m5.3 flash,它在本地部署方面啊,其实做的优化不如这个deepseekv4 flash。 呃v4 flash相对于v4 pro的话,它的总的参数是从呃671b相降到了284b激活的话是从37b降到了13b。呃,然后同时呢,也做了一些混合精度的就是呃fp4和fp8的一个混合精度的这个。优化,但是g m5.3 flash的话,相对于自家的5.25.3底座,它的这个绝对规模啊,虽然下降了,但是它的绝对规模仍然是相较于vlash更大的。呃官方默认的话也是f18的权重,并没有做fp4的一个半精度的优化啊。 所以如果说你要在本地去部署g m5.3 flash的话,需要的这个资源啊,应该是这个测算下来应该是v4 flash的一个1.5倍。所以整体上我们认为就是gm5.3的话是把后训练堆在可验证的一个长城任务上啊,所以在agent能力和长城任务包括安全性方面会有一些提升那flash的话,更多的它是一个新的架构啊,然后的话在具备这种成本优势的这种前提下的话呢?它在这个多模态方面啊,其实是一个 原生的能力啊,也是可能也是质朴相对啊。 呃比较原始的一个多模态的一个方案解决方案。那后面的话就是我们利用这样5.3和5.3 flash在呃三个任务上,包括估值任务回测任务以及行业分析任务上啊,我们去让这两个模型去做一些投研的实测。呃,当然,我们也会跟他跟这个deepseekv4的pro和flash包括k3的表现去做一个对比然后呃综合这种性价比啊,去给各位老师一个推荐,那第一个任务是二点,一的就是我们对于估值方面有个任务,就是我们让他以中继续创为研究对象,要求模型获取历史的财务和最新的经营数据,然后建立经营预测三张报表dcf和相对估值模型输出明。 敏感性分析和这个投资报告啊这一块的任务,我们主要想检验模型是否能够将业务转化成财务假设,然后保持这种收入啊,利润现金流和估值模型的一个联动,然后确保这个excel模型研究报告和投资结论啊,是不是可以相互一致?呃,那这边的话,我们首先看一下gm5.3的一个表现啊,我们认为它的呃整整个的表现还是非常不错的。在估值方面,我们认为呃它是能够呃相对来说更完善的去把量价拆解啊,三表和估值它们之间的关系形成一个闭环,然后最终版的话,它输出的也是一个公式化的这种excel啊,就是说我们如果更新其中的数据的话,其其他的一些相关的勾结关系,它可能可以自动化的去进行一个呃,进行一个更新。 那这样模电三的话是呃,也是交付了这种估值的工作部投资分析报告模型,假设说明数据来源执行记录,还有建模啊,验证脚本这样一些内容。呃收入端的话,它采取自下而上的一个量价模型啊,分别预测800g1.6t2.4t和400g以下这种呃产品的这个销量和均价,然后再加上其他业务的这个收入毛利率毛利率费用率资本开支等等。这样1些