登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
中文大模型基准测评2025年9月报告
信息技术
2025-10-16
-
SuperCLUE团队
光影
SuperCLUE九月中文大模型基准测评总结
核心观点与关键数据
国内外模型差距
:海外模型在通用能力测评中保持头部优势,TOP6均为海外模型,其中GPT-5(high)以69.37分领先。国内模型持续追赶,DeepSeek-V3.2-Exp-Thinking和Doubao-Seed-1.6-thinking-250715并列国内第一,分别以62.62分和60.96分位列国内前三。
开源模型表现
:国内开源模型全面领先海外开源模型,TOP10国内模型占据9席,DeepSeek-V3.2-Exp-Thinking以62.62分夺得开源榜首。海外开源模型仅gpt-oss-120b进入TOP10,得分为53.05分。
性价比与推理效率
:国内模型更具性价比,平均API价格为3.88元/百万Tokens,而海外模型平均API价格为20.46元/百万Tokens,是国内的5倍以上。海外推理模型推理效率远高于国内,平均耗时41.60秒,而国内为101.07秒。
测评分析
六大任务表现
:
数学推理与科学推理
:海外开源模型在数学和科学推理任务上具有优势。
代码生成
:国内模型表现优异,但在Web Coding子任务上与海外顶尖模型存在差距,平均得分相差41分。
智能体Agent
:国内外头部大模型整体表现相当,但在票证系统、即时消息、购物系统等简单工具调用任务上表现更好,复杂场景下得分较低。
精确指令遵循
:海外头部大模型表现优于国内,国内模型在处理复杂指令时鲁棒性较弱。
幻觉控制
:海外模型占据头部优势,Claude-Opus-4.1-Reasoning以85.24分夺冠,国内模型梯队分明,openPanGu-Ultra-MoE-718B位列第二。
趋势分析
:
随着指令数量增加,模型得分逐渐降低,海外模型在处理复杂任务时表现更优。
随着任务从“信息整合”向“开放生成”过渡,国内外模型在幻觉控制上的得分均下降。
评测与人类一致性验证
SuperCLUE基准测评成绩与人类对模型的评估(以LMArena为代表)高度一致,斯皮尔曼相关系数为0.9108,皮尔逊相关系数为0.8724。
SuperCLUE基准测评简介
SuperCLUE是大模型时代CLUE基准的发展和延续,聚焦于通用大模型的综合性测评,包含六大任务:数学推理、科学推理、代码生成、智能体Agent、精确指令遵循、幻觉控制。
SuperCLUE三大特征:Live更新、0数据污染、产业+用户视角。
榜单全景图
SuperCLUE构建了多领域、多层次的大模型综合性测评基准框架,涵盖通用基准体系、文本系列基准、多模态系列基准、推理系列基准、Agent系列基准、AI应用系列基准、性能系列基准。
9月测评模型列表
测评选取了33个国内外有代表性的大模型,包括Qwen3系列、DeepSeek系列、GLM系列、Gemini系列、GPT系列等。
联系我们
SuperCLUE提供通用大模型测评、多模态大模型测评、Agent智能体测评、大模型深度研究报告等服务,欢迎合作。
你可能感兴趣
中文大模型基准测评2025年上半年报告
信息技术
SuperCLUE团队
2025-08-04
中文大模型基准测评2025年5月报告
SuperCLUE团队
2025-05-28
中文大模型基准测评2025年3月报告
金融
SuperCLUE团队
2025-03-20
中文大模型基准测评2025年年度报告:2026开年特别版:含1月底重磅模型动态评测
信息技术
SuperCLUE团队
2026-02-04
中文大模型基准测评2024年上半年报告— 2024年度中文大模型阶段性进展评估
信息技术
SuperCLUE团队
2024-07-09
中文大模型基准测评报告2023-ChatGPT发布一周年特别报告
金融
SuperCLUE团队
2023-12-17
中文大模型基准测评2024年4月报告
稀宇科技&CLUE
2024-04-30
中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估
文化传媒
SuperCLUE团队
2024-11-11
中文大模型基准测评报告:ChatGPT发布一周年报告
信息技术
SuperCLUE团队
2023-11-28
2024中文大模型阶段性进展年度评估:中文大模型基准测评2024年度报告
信息技术
SuperCLUE团队
2025-01-08