登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
中文大模型基准测评2025年3月报告
金融
2025-03-20
SuperCLUE团队
林菁|Jade
2025年3月中文大模型进展评估SuperCLUE报告总结
1. 2025年度关键进展及趋势
关键进展时间线
:AI大模型发展分为准备期、跃进期、繁荣期和深化期,2025年处于深化期,国内外AI机构在推理模型、多模态领域取得显著进展。
中文大模型全景图
:涵盖通用闭源模型(如文心一言、通义千问)、开源模型(如Llama2、Qwen系列)、多模态模型(如文生图、文生视频)等。
国内外大模型差距
:总体趋势上,国内外第一梯队大模型在中文领域的通用能力差距正在缩小,从2023年5月的15.05%缩小至2025年3月的7.46%。
2. 年度通用测评介绍
SuperCLUE基准介绍
:独立、领先的通用大模型综合性测评基准,具备“Live”更新、0数据污染、产业+用户视角三大特征。
SuperCLUE大模型综合测评体系
:覆盖通用基准、文本专项、多模态、推理、Agent、AI应用、性能等多个维度。
SuperCLUE通用测评基准数据集及评价方式
:包含数学推理、科学推理、代码生成、智能体Agent、精确指令遵循、文本理解与创作六大维度,采用人工校验、代码单元测试等多种评估方式。
3. 总体测评结果与分析
SuperCLUE通用能力测评总榜
:o3-mini(high)稳居第一(76.01分),DeepSeek-R1(70.34分)位列国内第一。
SuperCLUE模型象限
:分为潜力探索者、技术领跑者、实用主义者和卓越领导者四类,DeepSeek-R1和o3-mini(high)处于卓越领导者象限。
SuperCLUE推理模型总榜
:DeepSeek-R1(78.97分)和QwQ-32B(79.15分)位列前二,国内推理模型在数学推理和代码生成任务上表现优异。
SuperCLUE推理任务总榜
:推理模型较基础模型优势明显,o3-mini(high)、DeepSeek-R1和QwQ-Max-Preview表现突出。
SuperCLUE基础模型总榜
:Doubao-1.5-pro-32k-250115(64.69分)位列第一,国内基础模型较海外略有落后。
性价比区间分布
:国产推理模型(如DeepSeek-R1、QwQ-32B)和基础模型(如Qwen-max-latest、DeepSeek-V3)展现出显著性价比优势。
综合效能区间分布
:海外模型(如o3-mini(high)、Gemini-2.0-Flash-Thinking-Exp-01-21)在推理速度和准确度上领先,国内模型仍有提升空间。
国内大模型成熟度-SC成熟度指数
:国内大模型在文本理解与创作能力上成熟度较高,科学推理、代码生成中等,数学推理、精确指令遵循、智能体Agent成熟度较低。
评测与人类一致性验证
:SuperCLUE得分与Chatbot Arena得分高度一致(皮尔逊相关系数0.89)。
开源模型榜单
:DeepSeek-R1(70.34分)位列第一,DeepSeek-R1-Distill系列表现优异。
10B级别小模型榜单
:DeepSeek-R1-Distill-Qwen-7B(39.07分)和Gemma-2-9b-it(28.30分)位列前二,国内模型展现出极致性价比。
端侧5B级别小模型榜单
:Qwen2.5-3b-Instruct(22.18分)位列第一,国内端侧小模型在中文场景下表现优异。
4. DeepSeek系列模型深度分析
DeepSeek-R1及其蒸馏模型对比
:DeepSeek-R1在各个维度均领先,蒸馏模型(如R1-Distill-Qwen-32B)在推理任务中表现接近源模型。
DeepSeek-R1和国内外头部推理模型对比
:DeepSeek-R1综合能力接近海外头部模型,数学推理和代码生成任务表现优异,科学推理仍需优化。
DeepSeek-R1第三方平台联网搜索能力测试(网页端)
:腾讯元宝综合实力领先,基础检索能力强,分析推理能力是关键差异点。
DeepSeek-R1第三方平台稳定性测试
:Perplexity、together.ai等国外平台在回复率和推理耗时上表现优于国内平台,付费版稳定性显著优于免费版。
DeepSeek-R1第三方稳定性测试(App端)
:学而思的随时问、秘塔AI搜索等App稳定性优异,钉钉和腾讯文档等App稳定性较低。
DeepSeek-R1第三方稳定性测试(API端)
:火山引擎、商汤大装置等API接口输出效率高,Together.ai领先,微软云API效率最低。
你可能感兴趣
中文大模型基准测评2025年9月报告
信息技术
SuperCLUE团队
2025-10-16
中文大模型基准测评2025年5月报告
SuperCLUE团队
2025-05-28
中文大模型基准测评2025年上半年报告
信息技术
SuperCLUE团队
2025-08-04
中文大模型基准测评2025年年度报告:2026开年特别版:含1月底重磅模型动态评测
信息技术
SuperCLUE团队
2026-02-04
中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估
文化传媒
SuperCLUE团队
2024-11-11
中文大模型基准测评报告:ChatGPT发布一周年报告
信息技术
SuperCLUE团队
2023-11-28
中文大模型基准测评2024年上半年报告— 2024年度中文大模型阶段性进展评估
信息技术
SuperCLUE团队
2024-07-09
中文大模型基准测评报告2023-ChatGPT发布一周年特别报告
金融
SuperCLUE团队
2023-12-17
中文大模型基准测评2024年4月报告
稀宇科技&CLUE
2024-04-30
2024中文大模型阶段性进展年度评估:中文大模型基准测评2024年度报告
信息技术
SuperCLUE团队
2025-01-08