2025年上半年中文大模型进展
2025年上半年,大模型领域进入智能体崛起与AGI探索期,顶级大模型能力持续突破,性能与效率并进。o3、o4系列、Gemini 2.5系列等顶级模型发布,推理能力提升明显,工具调用能力增强。Monica.im发布全球首款通用型AI Agent:Manus,成为AI领域的重大突破。国内AI智能体潜力被深度挖掘,大量AI Agent产品涌现,如AutoGLM、OpenManus等。国内模型加速迭代与开源,DeepSeek-R1等开源模型引爆全球,缩小国内外差距。
SuperCLUE基准测评结果
SuperCLUE基准测评结果显示,海外头部模型o3、o4-mini(high)和Gemini-2.5-Pro在通用能力测评中分别取得73.78分、73.32分和68.98分的总成绩,位于榜单前三。Doubao-Seed-1.6-thinking-250715以68.04的总分取得国内第一、全球第四的成绩。国内外头部模型在推理任务上的差异较大,海外模型优势明显。国内开源模型相较于海外开源模型优势显著,DeepSeek-R1、Qwen3-235B-A22B-Thinking-2507和GLM-4.5分别以66.15分、64.34分和63.25分取得开源榜单前三。国内大模型在智能体Agent和幻觉控制任务上的表现良好,但在推理任务上稍有逊色。Qwen3系列的开源小参数量模型表现亮眼,如8B、4B和1.7B版本在10B级别和端侧5B级别的榜单中遥遥领先。
国内大模型成熟度
国内大模型成熟度指数(SC成熟度指数)显示,高成熟度能力指大部分闭源大模型普遍擅长的能力,当前国内闭源大模型成熟度较高的任务暂时没有。中成熟度指不同大模型能力上有一定区分度,当前国内大模型表现出中成熟度的能力是数学推理、智能体Agent、科学推理和代码生成。低成熟度指少量大模型较为擅长,很多模型无法胜任,当前国内大模型低成熟度的能力是幻觉控制和精确指令遵循。
评测与人类一致性验证
SuperCLUE基准测评成绩与人类对模型的评估(以LMArena为代表)具有高度一致性,斯皮尔曼相关系数为0.8972,皮尔逊相关系数为0.8656。