Gemini 2.5 系列模型在架构、训练和数据处理方面取得了显著进步,性能大幅提升。模型架构采用了稀疏混合专家模型,并支持多模态输入,包括文本、视觉和音频。训练方面,模型在 TPUv5p 架构上进行训练,并采用了弹性训练和 SDC 错误缓解技术,提高了训练稳定性。数据处理方面,模型使用了大规模、多样化的数据集,并采用了新的方法进行数据过滤和去重。
Gemini 2.5 系列模型在多个能力方面取得了显著提升,包括:
- 代码能力: 在 LiveCodeBench、Aider Polyglot 和 SWE-bench Verified 等基准测试中取得了优异成绩,显著优于之前的 Gemini 模型。
- 数学和推理能力: 在 AIME 2025 和 GPQA (diamond) 等基准测试中取得了显著提升。
- 图像和视频理解能力: 能够处理 3 小时的视频,并将演示视频转换为交互式编码应用程序。
- 多语言能力: 支持超过 400 种语言,并在印度语、中文、日语和韩语等语言上取得了显著进步。
- 音频能力: 能够进行音频生成任务,如文本到语音和原生音频对话。
- 视频能力: 扩展了视频理解数据,提高了模型对音频-视频和时序的理解能力。
- 长上下文能力: 能够处理长达 100 万个 token 的上下文,并在 LOFT 和 MRCR 长上下文任务中取得了最先进的性能。
Gemini 2.5 Pro 在玩《宝可梦》游戏中展现了出色的推理和长期规划能力,能够解决复杂的谜题和长路径问题,并保持策略一致性。然而,模型在屏幕阅读、长上下文推理和避免重复行动方面仍存在挑战。
Gemini 2.5 系列模型在安全方面也取得了显著进步,采用了多种安全训练和评估方法,包括数据过滤、条件预训练、监督微调、强化学习和自动红队测试。模型在内容政策违规、不公平偏见和模态特定风险方面表现良好,并在 Frontier Safety Framework 评估中未达到任何关键能力水平。
Gemini 2.5 系列模型在多个 Google 产品中得到应用,包括 AI 概览、AI 模式、NotebookLM、Project Astra 和 Google 编码代理等。