您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 未知机构:《华福AI互联网GPT 6测评纪要》-发现报告

华福AI互联网GPT 6测评纪要

2026-09-05 未知机构 飞鹤萘酚
报告封面

发布时间:2026-09-05 一、AI总结内容 一、核心测评结论 1. 华福AI互联网组对OpenAI GPT-6与Anthropic Claude 5.1开 展实测,二者输入输出标价均为每百万token10美元、50美元,价格无明显差距,但技术路径差异化明显 2. 多轮案例对比显示,GPT-6在网球比赛可视化、密室逃脱游戏生成等多模态、参数化建模、办公自动化场景表现超预期;Claude 5.1在存储介质演化深度、打车软件交互功能、内容广度与思考深度上更具优势 3. 办公自动化是两款模型共同兑现的核心方向,其中GPT-6在该场景的增益幅度更大 二、价格与成本分析 1. OpenAI上调GPT系列模型价格,Anthropic保持Claude 5.1列表价不变,仅将缓存读取价从1美元降至0.25美元,缓存读取已成为海外厂商价格竞争的核心2. GPT-6输入超27.2万token时需按2倍输入计费,Claude 5.1则无此额外计费规则,长任务场景下Claude 5.1缓存读取成本更低3. 按任务单位成本计算,Claude 5.1当前成本高于GPT-6,对泛白领工作性价比不如OpenAI旗下部分模型 三、行业与估值观察 1. OpenAI年化收入从250亿美元增至400亿美元,估值倍数从34倍降至21倍;Anthropic年化收入从300亿美元升至650亿美元,实现首个盈利季,估值倍数从20.5倍降至15倍,Anthropic已在收入规模与估值倍数上反超OpenAI2. GPT-6的发布标志OpenAI将算力布局于执行闭环场景,Anthropic则聚焦认知深度方向,二者差异化竞争格局确立 四、风险与后续关注点 1. OpenAI收入中订阅占55%、API占30%,企业端API付费能力能否持续支撑高估值需进一步观察2. 长任务场景下的成本优化、模型能力迭代及行业竞争态势为后续跟踪重点 二、音频原文(转写) 大家好,欢迎参加华福ai互联网gbt6测评,目前所有参会者均处于静音状态下面开始播报声明本次会议仅面向华福证券的专业投资机构客户或受邀客户第三方专家发言内容仅代表其个人观点所有信息或观点不构成投资,建议根据监监管规定会议不得交流敏感内幕信息未经华福证券事先书面许可任何机构或个人严禁录音制作纪要转发转载传播复制编辑修改等。涉嫌违反上述情形的,我们将保留一切法律权利。 感谢您的理解和支持。谢谢各位领导晚上好,我是华府ai互联网组的新荣度。嗯,9月3号这一天呢?Openai这边是发了gpt6s. Tra,然后anthropy前几天是发了cloud favor5.1嗯这两个模型呢? 它其实输入和输出的标价都是每百万token10美元和50美元。嗯,所以从价格来看的话其实是没有什么差距的。但是我们会发现在价格一样,前提条件下其实两个的呃分化路径是完全不一样的,然后这边我们自己也去做了一些测评,就先跟大家看一下整个测评结果。就是之前我在去讲fable5.1的时候,其实有让他去做一个网球比赛的这个prompt呃,这个案例,然后我们现在看到的是fable5.1做的,嗯就整体来看的话,其实它也是一次性交付的,然后整个的交互功能呀之类的,没有什么太大的问题,然后再来看一下就是同一个prom会给gbt6做出来的效果。 这个是gpt6做出来的效果,就是可以看出来它整个的可视化效果呀,呃相对来说也是比较好的,而且就是在同一个prom下,其实他自己给自己加的这些功能啊,以及还有整个动画也都是比较完善的。嗯,这是第1个例子,那我除了让他去跑1个网球比赛的例子以外呢,就是我当时还有让他进行就是用一句话去生成了一个密室逃脱的这个游戏,就咱们可以看到这是gbt6生成的啊,然后当时在生成这个游戏的时候呢,我其实给的提示词也非常简单,我就说能否就是呃把这个类似于cs界面的这种嗯密室逃脱游戏去生成一下然后咱们可以看一下整个的交付,呃其实是没有任何问题的,包括还有整个的移动呀啊,还有选点呀,这些都是可以玩的,对然后整个的划分,其实我觉得在我没有给任何参照的基础上,它其实相对来说做的也是呃比较好的。 嗯嗯然后这个是gpt6跑出来的一些,就是我觉得整体看下来比较超预期的案例。嗯,这次其实我在网上呀,包括还有整个的这个官方呃公布的口径也可以看出来,其实gpt6,它主要是在这个呃多模态呀,包括还有整个的参数化建模以及办公自动化,这边确实有一些突破。嗯,所以这一块呢是他擅长的领域哦,那但是整体我们看下来和飞豹5.1去比飞豹5.1是在什么方向更擅长呢?其实我觉得就是在思考的这个深度。 嗯,还有广度上其实我觉得会比gbt6这边做的,嗯,相对来说就是差异化更明显一些,就这边我们可以看到有一个案例是当时我去让这两个模型都跑了一下这个存储的眼镜。嗯,然后这边呢是fable去跑的那feo跑下来,结果我们会发现就是它会带图,然后包括它每一代的这个介质换代都写的比较清楚。嗯,它还会给我就是自己去生成了一个交互式东西去,让我感受一下这个存储的介质,换代它到底要占多少的介质。 嗯,然后我们再来看一下gpt6做的哦,这个是gbt6做的,就整个看下来,其实他做的呢,就是把几个主要的内容点到了。但是相对来说,这个内容的这个广度包括还有深度,我觉得和刚才的这个呃飞布比起来的话会稍微就是还有个提升空间。然后除了这个以外呢,还有1个就是打车软件的案例就打车软件的案例,当时飞博5.1出来的时候,我们也去测了一下,就当时飞博5.1它做出来的呢,其实是可以把整个行程就是。 我可以在地图上进行一个交互式的选点定位,然后包括它还支持模糊搜索啊,但是包括整个呼叫车辆,一直到我去跑完整一趟行程,它这一块都是能做到的。嗯,也就是说其实它这个定位方面呢,它是联网搜索就大家也可以看到我这边其实是挂了呃这个背片的,然后这一块呢,它相当于相当于来说的话,它是可以把整个地图上的就已有的县城的这些地址它都能搜到然后gpt6这边做的呢?在同一个prom下呃,其实我们会发现它的这个选点,它就只能是视力地点,就相当于只能跑这一趟哦。 但是我就是不能进行一个交互式选点,包括我去帮我去搜对他这个它这个其实是搜不出来的。嗯,所以从这个角度来看的话,我觉得就是从内容的广度和深度上面其实fable5.1会比gbt6做的要稍微好一些,嗯,就可以看出来两家其实是打的是完全一个差异化的路径。嗯,那上面四条,我们可以看到就是astra,其实要比fable5.1做要更好一些。像在办公自动化呀,还有参数化建模这一块儿,那这个官方给的这个口径也和我们测评结果来说是非常吻合的啊,整个看起来确实在这个前端和呃办公方面要强一些,那下面 这一块呢就是飞博5.1要更强的了,主要是体现在这个智能,包括还有一些就是呃做一些长城任务,上面它其实会有更它可以自己去发挥一些主观能动性,然后相对于来说就是它做得更好,就是在一些比较简单的prom下面啊。 然后我们这边可以再看一下,就是我这边罗列一下astra相对相对于上一家的这个so,它的增益点在哪,然后包括飞豹5.1,它相对于上一代的这个飞博,它的增益在哪里?那我们可以看到astra这一块呢,它主要还是在这个办公自动化。呃上面使劲儿,而且长得是非常多的,那非5.1这一块呢,它是在科学终端。任务上嗯,它翻倍翻的比较多。 嗯,那这边我们都可以看到,有个共同点就是说在办公司的话呢,其实两边都是大涨的,而只是astra,它涨的要多一些,那也就是说其实无论走哪条路呢?我觉得当前的这个办公场景自动化也都是这一代模型,它共同去兑现的一个方向,然后我们这边再来看一下整体的这个价格。嗯,当前我们这个图里面纵轴是一个输出的标价,然后我给的是一个对数刻度,然后横轴这边呢。我是给的是一个呃自家产品的一个从低档到旗舰的一个四个档位红线,这边是openai。 然后蓝线是anthropic那astra,其实对于自己家的这个so呢,它涨的是2.5倍,那过去十几个版本里面我们可以看到新1代呢,它通常是同价或者说更便宜的,给到我们更强的这个能力啊,但这一次其实不是,然后第二点就是anthropy这边的这个标价呢,它是1分没有动过的像fable5.1和fable5来比它的输入输出的这种列表价呢,它是完全一样的,那它动的只有一个数就是这个缓存毒,它是从一美元降到2毛5嗯,然后第三点呢,就是我们可以看啊,下面其实就是灰色线以下呢,就是这个国产的型号的这个价格区间那上端这个kimi ki3呢,它是15美元,然后一直到小米mimo呢,它是2毛8,那也就是说,其实这一条带子大概是差了一到两个数量级左右。 呃,其实之前我去讲飞博5.1的时候我有去讲过说这个缓存命中价呢,主要改嗯,主要的是一个呃,在这方面做了一个调整,那也就是说,如果这个缓存毒,它在整个任务里面,它的占比比较高,就像长城任务啊,包括还有一些高频率复用的一些场景,那其实对于这一类的任务来讲啊,其实用这种贵价模型尤其像菲博5.1啊,还有这bt6,它相对来说是比较划算的,那我们再反观这个astra astra,它其实是从十美元掉到了一美元,然后fever5.1这边是掉到了2毛5嗯,那相当于是这个统一档的这个缓存命中价,它大概是差了四倍左右。 嗯,所以我就是也想嗯,从这个两个标价里面我提到就是以后,如果我们再去看这个价格的话,就嗯别只看这个列表的输入输出价,因为当前这个海外龙头其实如果再去打这个价格战的话,其实基本上是在打这个缓存读取那astra这边呢,还有一条就是它会规定说输入超过呃272000 token的这个请求呢,它会按照两倍的输入去计算。嗯,从这个角度上来看呢,就是如果超过这个投恳数的话,其实它会比呃菲薄5.1要贵一些。 那我们这边再看一下整个的单位智能成本。嗯,就这边我还是像之前讲facebook5.11样的,我去做了一个嗯坐标就是这一块儿呢。我给的是一个artificial analysis的智能指数,然后我横轴给的是一个输出的标价,那这边我们可以看到cloud facebook5.1呢,它相对于来说是最贵的。然后也是智能指数里面相对来说比较高的一个模型,然后gbt6 astra呢,它和飞波五基本上是在同一个水平线上哦,那也就是说其实除去这个飞波5.1的话,嗯,其实clo5和gbt6 as tra相对来说也是一个就是价格方面是比较接近的。 嗯,然后呢再除去这2个模型以外呢,我们再看剩下的其实oppos5和gbt5.6相对来说也是嗯,整体看下来就是效果比较好,然后价格也比较贵。那cloud oppos5在这里面呢可能相对来说是对于泛白领工作性价比比较高的一个模型。然后这边呢,我也去收集了一下,就是我这边给的是一个自己去做任务的输出的token的用量啊,然后呃我们可以看到就是飞波5.1呢,它大概是每任务3.076美元,它会比fable5的3.14贵两成左右,然后它会比oppo四五的呃2.34贵6成。 我们会发现就是这个列表价,它其实是没有变过的,但是我们实际付的这个钱呢,反倒会涨啊,这是为什么呢?因为就是菲博5.1,它相对于菲伯五来说,它会想的更久一些。呃,除了想的更久1些,官方也去专门强调它的自我检验的能力更强一些,那自我检验能力更强,一些的话就说明其实。嗯,他在做这个任务的时候,它产出会变慢啊,但是它的这个精准度呢会提高,所以这个输出token,大约就是呃,比上一代贵了1.7倍左右。 嗯,这也正好就是印证了。我们之前说这个认知的深度路线,因为整个深度呢,它是要去付钱的,那astra的方向刚好是相反的。呃,因为astra,它会比so省略大概是一成的。这个输出token,然后token的效率呢? 它是高了约七成左右嗯,但是这个标价呢是2.5倍呃,整个看下来的话就是它会在呃不同模型之间呢,就是如果我们给的同一个prompt,其实astra,它会比so它会效率更高一些。然后这个是成本端,那这边我们最后再看一下收入和估值就是openai呢,它是从2月的5月a.R1直在250亿附近打转,然后8月的时候,它披露的时候是400亿了,艾特这边呢,4月大概