登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估
文化传媒
2024-11-11
SuperCLUE
SuperCLUE团队
惊雷
中文大模型基准测评总结
1. 国内外大模型竞争现状
OpenAI
发布的 o1 版本大幅提升了大模型之间的竞争水平,国内大模型正逐步接近 Claude 3.5 Sonnet 和 ChatGPT-4o-latest 的能力。
国内大模型第一梯队竞争激烈,部分模型如 Qwen2.5-72B-Instruct、DeepSeek V2.5、TeleChat2-35B 等表现出色,部分小尺寸模型如 Qwen2.5-1.5B-Instruct、MiniCPM3-4B 展现出较高性价比。
2. 各类模型表现
国内大模型
在中文通用能力和 Hard 任务上与国外顶级模型存在差距,分别约为 8% 和 14%。
开源模型
如 Qwen2.5-72B-Instruct 和 DeepSeek V2.5 领跑全球开源模型,TeleChat2-35B 表现也十分出色。
闭源模型
如 GLM-4-Plus、SenseChat 5.5、AndesGPT-2.0 与 ChatGPT-4o-latest 相距不到 2 分。
3. 多模态及端侧小模型
端侧小模型
进展迅速,部分小尺寸模型如 Qwen2.5-1.5B-Instruct 和 MiniCPM3-4B 表现优于上一代稍大尺寸模型,显示出较高的性价比和落地可行性。
4. 通用能力测评
SuperCLUE
作为独立第三方评测机构,采用多维度、多层次的测评方案,涵盖理科、文科和 Hard 三大维度。
测评结果表明,国内外大模型在不同任务上的表现各有优势,GPT 系列模型在 Hard 任务上表现卓越,国内大模型则更擅长理科和文科任务。
5. 未来展望
2023-2024 年,国内外大模型技术持续发展,差距逐渐缩小,但仍存在一定的差距。
未来两个月将发布更多基准测评结果,提供更多维度的模型对比分析。
你可能感兴趣
中文大模型基准测评2024年上半年报告— 2024年度中文大模型阶段性进展评估
信息技术
SuperCLUE团队
2024-07-09
2024中文大模型阶段性进展年度评估:中文大模型基准测评2024年度报告
信息技术
SuperCLUE团队
2025-01-08
中文大模型基准测评2023年度报告:AI跃迁的2023,中文大模型进展评估
SuperCLUE团队
2023-12-28
中文大模型基准测评2024年4月报告
稀宇科技&CLUE
2024-04-30
中文大模型基准测评2025年9月报告
信息技术
SuperCLUE团队
2025-10-16
中文大模型基准测评2025年5月报告
SuperCLUE团队
2025-05-28
中文大模型基准测评报告:ChatGPT发布一周年报告
信息技术
SuperCLUE团队
2023-11-28
中文大模型基准测评2025年3月报告
金融
SuperCLUE团队
2025-03-20
中文大模型基准测评2025年上半年报告
信息技术
SuperCLUE团队
2025-08-04
中文大模型基准测评报告2023-ChatGPT发布一周年特别报告
金融
SuperCLUE团队
2023-12-17