2025年5月中文大模型进展
关键进展: 自ChatGPT发布以来,AI大模型领域在过去两年半取得了实质性突破,经历了准备期、跃进期、繁荣期、深化期和融合期。2025年上半年,国内外大模型研发加速,国内模型在多模态领域取得进展,并在部分领域领先海外。
国内外差距: 总体趋势上,国内外第一梯队大模型在中文领域的通用能力差距正在缩小。2023年5月至今,GPT系列模型等海外模型能力持续发展,国内模型也经历了多次迭代。但随着o4-mini的发布,国内外Top1模型差距分数从7.46%增加至10.42%。
中文大模型全景图: 2025年最值得关注的中文大模型包括文心一言、通义千问、讯飞星火、360智脑、ChatGLM等闭源模型,以及Baichuan、Qwen、InternLM、ChatGLM3、Yi-34B等开源模型。多模态领域,视频生成模型可灵AI、海螺视频、vidu、PixVerse等模型取得进展。
SuperCLUE基准测评: SuperCLUE是大模型时代背景下CLUE基准的发展和延续,是独立、领先的通用大模型的综合性测评基准。测评体系覆盖通用基准体系、文本专项系列基准、多模态系列基准、推理系列基准、Agent系列基准、AI应用基准、性能系列基准。
总体测评结果与分析:
- 模型象限: 根据推理能力和应用能力,模型被分为潜力探索者、技术领跑者、实用主义者和卓越领导者四个象限。
- 通用能力测评榜单: o4-mini(high)总分稳居第一,Doubao-1.5-thinking-pro-205415在文本创作与理解任务上领先。国内推理模型如NebulaCoder-V6、Doubao-1.5-thinking-pro-250415和360zhinao2-o1.5表现亮眼。
- 开源模型榜单: DeepSeek系列开源模型、Qwen系列开源模型表现优异,引领全球开源生态。
- 推理模型榜单: Qwen3-235B-A22B(Thinking)在代码生成任务中位居国内榜首,国内模型在数学推理、科学推理、代码生成三大任务上相互竞争。
- 智能体测评分析: 各应用场景上成熟度差异显著,票证系统和文件系统场景成熟度较高,智能购物和旅游出行场景成熟度较低。推理模型领先于基础模型,海外模型领先,国内最好模型与海外顶尖水平仍有一定差距。
- 性价比区间分布: 国产推理模型和基础模型凭借较低的价格实现高质量输出,展现出显著的性价比优势。
- 综合效能区间分布: 360zhinao2-o1.5和Gemini系列模型综合效能表现领先,国内推理模型大部分处于中低效能区间,国内基础模型大部分处于中低效能区间。
- 国内大模型成熟度: 国内大模型成熟度较高的能力是文本理解与创作,中成熟度的能力是代码生成、智能体Agent,低成熟度的能力是精确指令遵循、数学推理和科学推理。
- 评测与人类一致性验证: SuperCLUE得分与Chatbot Arena得分具有高度一致性,皮尔逊相关系数为0.86,斯皮尔曼相关系数为0.89。
- 10B级别小模型榜单: DeepSeek-R1-Distill-Qwen-7B和Gemma-2-9b-it分列国内外榜首,Qwen3系列模型在10B以内模型中表现优异。
- 端侧5B级别小模型榜单: Qwen3-4B(Thinking)表现惊艳,取得总分46.04分的优异成绩,MiniCPM3-4B小模型同样表现不俗。