您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:Google 2025年IO大会会议纪要 - 发现报告

Google 2025年IO大会会议纪要

2025-05-21 未知机构 风与林
报告封面

SundarPichai,CEO 通常情况下,在I/O大会之前几周,你们不会听到我们太多消息。这是因为我们会把最好的模型留到这个舞台上展示。但在Gemini时代,我们希望尽快将最好的模型交到你们手中,并应用到我们的产品中。因此,我们的发布速度比以往任何时候都要快。自上次以来,我们已经宣布了超过12个模型和研究突破,并发布了20多个主要的人工智能产品和功能。我对模型的快速进步特别兴奋。你可以在这里看到一个阶跃函数的变化。这是衡量进步的一个指标,自Gemini1.0Pro以来已经提高了300多分。 今天,Gemini2.5Pro在语言模型竞技场的所有类别中都占据了榜首,它在许多基准测试中处于世界领先水平。我们还在快速进步,更新后的2.5Pro在WebDevArena上排名上升至第1位。它在顶级编程平台上获得了大量好评。作为领先的AI代码编辑器,Gemini是今年增长最快的模型,在每一分钟内都能产生数十万行被接受的代码。 最后一个里程碑可能在某些圈子里是最令人印象深刻的。几周前,Gemini完成了《宝可梦蓝》。它获得了全部八枚徽章,前往胜利之路,击败了四天王和冠军,让我们离实现API,即人工宝可梦智能(ArtificialPokemonIntelligence)更近了一步。 所有这些进步都得益于我们世界领先的基础设施,这是我们人工智能全栈方法的基础,我们的第七代TPUIronwood是第一个实现大规模推理和思考的设计。与上一代相比,它的性能提高了10倍,每个pod的计算能力达到了惊人的42.5exaFLOPS。今年晚些时候,它将向谷歌云客户开放。 我们的基础设施实力,包括TPU在内,帮助我们提供了更快的模型。在语言模型竞技场排行榜上,Gemini在每秒生成的最高输出标记数方面占据了前三名。与此同时,模型价格大幅下降。价格和性能之间存在一个艰难的权衡。然而,我们一次又一次地能够在最有效的价格点提供最好的模型。谷歌不仅引领了这一前沿领域的游行,我们从根本上改变了前沿本身。结果是,更多的人可以在任何地方获得更多的智能,世界正在做出回应,比以往任何时候都更快地采用人工智能,这是进步的一个标志。 去年这个时候,我们在产品和API中处理了9.7万亿个标记。现在,我们每月处理480 万亿个标记。这大约是一年内的50倍增长。 我们还看到开发人员对人工智能工具的采用浪潮。今天,超过700万开发人员在谷歌AIStudio和VertexAI上使用GeminiAPI进行开发。自上次I/O以来,增长超过了5倍,Gemini在VertexAI上的使用量自去年以来增长了40多倍。 人工智能在我们产品中的采用正在增加。Gemini应用程序现在每月有超过4亿月活跃用户。 我们看到了强劲的增长和参与度,特别是对于2.5模型。对于在Gemini应用程序中使用2.5Pro的用户,使用量增长了45%。稍后你会听到更多关于Gemini应用程序的内容。我们还在搜索领域看到了令人难以置信的势头。今天,AIOverviews每月有超过15亿用户。这意味着谷歌搜索比世界上任何其他产品都更多地将生成式人工智能带给人们。 除了AIOverviews之外,人工智能模式是搜索领域的下一个重大步骤。稍后你会听到更多相关内容。所有这些进步意味着我们正处于人工智能平台转型的新阶段,数十年的研究正在成为世界各地人们的现实。 我想分享三个例子,说明研究是如何改变我们今天的产品的:Starline、Astra和 Mariner。 我们在几年前的I/O大会上首次推出了Starline,这一突破性的3D视频技术。目标是在你们相隔很远的情况下,也能创造出仿佛身处同一房间的感觉。我们继续取得技术进步。今天,我们准备宣布我们的下一章,推出GoogleBeam,这是一个新的以人工智能为先的视频通信平台。Beam使用一种新的最先进的视频模型,将二维视频流转换成逼真的三维体验。在幕后,一个由六个摄像头组成的阵列从不同角度捕捉你的影像。借助人工智能,我们可以将这些视频流合并在一起,并在三维光场显示器上渲染你,实现近乎完美的毫米级头部跟踪,每秒60帧,全部实时进行,从而带来更加自然和深度沉浸式的对话体验。我们非常兴奋地将这项技术带给其他人。与惠普合作,第一批 GoogleBeam设备将于今年晚些时候向早期客户提供。几周后,惠普将分享更多相关内容。敬请期待。 多年来,我们一直将Starline的底层技术引入谷歌备忘录,包括实时语音翻译,以帮助打破语言障碍。下面是一个例子,说明在南美洲预订度假出租屋时,如果你不会说当地语言,这将如何发挥作用。我们来看一下。你可以看到它与说话人的语调模式甚至表情是多么地契合。我们现在离跨越语言进行自然流畅的对话更近了一步。今天,我们正在谷歌备忘录中直接引入这种实时语音翻译。英语和西班牙语的翻译现在已向订阅用户开放,未来几周将推出更多语言。今年晚些时候,实时翻译将向企业推出。 另一个在I/O舞台上首次亮相的早期研究项目是Astra项目。它探索了一个通用人工智能助手的未来能力,该助手能够理解你周围的世界。今天,我们开始将其引入我们的产品,GeminiLive作为Astra项目的相机和屏幕共享功能。因此,你可以谈论你看到的任何内容,人们正在以如此多的方式使用它,他们正在为工作面试做准备,或者为马拉松做训练。我们一直很欣赏我们值得信赖的测试者们的反馈,以及一些不太值得信赖的测试者们的反馈。Gemini在告诉你何时出错方面相当出色。从今天开始,我们将在安卓和iOS上向所有人推出这一功能。 接下来,我们还有一个研究原型项目——Mariner项目,它是一个可以与网络互动并完成任务的代理。退一步说,我们将代理视为将先进人工智能模型的智能与工具的使用权限相结合的系统。它们可以在你的授权下代表你采取行动。计算机使用是一种重要的代理能力,它使代理能够与浏览器和其他软件进行互动和操作。 Mariner项目是我们早期在测试计算机使用能力方面迈出的重要一步。我们在12月将其作为早期研究原型发布,并且自那以后我们取得了很大的进步。首先,我们引入了多任务处理功能,它现在可以同时管理多达10个任务。其次,它使用了一种名为“TeachandRepeat”的功能。你可以向它展示一次任务,它就能学会为未来类似的任务制定计划。我们正在通过GeminiAPI将Mariner项目的计算机使用能力带给开发人员,并且今年夏天它将更广泛地开放给更多开发者。 计算机使用能力是我们为构建繁荣的代理生态系统所需的一整套工具的一部分,比如我们的开放代理间协议,以便代理之间能够相互交流。我们与超过60家技术合作伙伴的支持下启动了这一协议,并希望看到这个数字不断增长。还有由Anthropic引入的模型上下文协议,使代理能够访问其他服务。今天,我们很高兴地宣布,我们的GeminiSDK现在与MCP工具兼容。这些技术将协同工作,使代理变得更加有用,我们开始将代理能力引入Chrome搜索和Gemini应用程序。 让我向你展示我们为之兴奋的内容。在Gemini应用程序中,我们称之为AgentMode。假设你想在奥斯汀为你和两个室友找一套公寓。你们每人每月的预算为12美元。你希望公寓里有洗衣机和烘干机,或者至少附近有自助洗衣店。通常情况下,你不得不花费大量时间浏览无尽的房源列表。使用代理模式,Gemini应用程序会在幕后开始工作。它会从Zillow等网站中找到符合你标准的房源列表,并在需要时使用Mariner项目来调整非常具体的筛选条件。如果你想要查看某个公寓,Gemini会使用MCP来访问房源信息,甚至代表你安排看房。只要你需要,它就会继续为你寻找新的房源。这为你腾出了时间去做你真正想做的事情,比如计划乔迁派对。这对像Zillow这样的公司来说也很棒,可以吸引新客户并提高转化率。Gemini应用程序中AgentMode的试验版本将很快向订阅用户推出。 这是一个新兴领域,我们很兴奋地探索如何最好地将代理的好处带给用户和更广泛的生态系统。将研究带入现实的最好方式是让它在你自己的现实中真正有用。这就是个性化将发挥强大作用的地方。我们正在通过我们称之为“Personalcontext”的东西将其变为现实。在获得你的许可后,Gemini模型可以以一种私密、透明且完全受你控制的方式使用你谷歌应用程序中的相关上下文。举个例子。在Gmail中,你可能熟悉我们的AI驱动的智能回复功能。它们的受欢迎程度令人惊叹。现在,想象一下如果这些回复能听起来像你。这就是个性化智能回复的想法。这一功能将于今年夏天在Gmail中向订阅用户推出,你可以想象个人上下文在搜索、聊天、Gemini等应用中的帮助有多大。 今天,我谈到了智能代理和个性化。这些是我们将取得进展的几个前沿领域,你将在整个主题演讲中听到更多例子。 DemisHassabis,CEOandco-founderofGoogleDeepMind 我们正处于历史上的一个非凡时刻,人工智能正在创造一个令人惊叹的全新未来。对我们来说,过去一年是持续进步的一年。 正如桑达尔所说,人们喜欢与Gemini2.5互动。我们看到你们用它进行代码创作,一次性构建游戏和应用程序。你们利用它强大的推理能力,从解读科学论文到理解YouTube视频,无所不用。你们告诉我们,使用Gemini是多么富有协作性、洞察力和真正有帮助。看到你们所有人用它做和构建的这些了不起的事情,对我们来说太令人 兴奋了。 Gemini2.5Pro是我们迄今为止最智能的模型,也是世界上最好的基础模型。就在两周前,我们发布了一个更新版的2.5Pro预览版,以便你们能够立即上手并开始使用它进行构建。你们所创造的东西让我们印象深刻,从将草图变成交互式应用程序到模拟整个三维城市。新的2.5Pro在流行的WebDevArena编程排行榜上位居榜首。现在它整合了学习型语言模型(LearningLM),这是我们与教育专家共同构建的模型家族,2.5Pro也成为了学习领域的领先模型,并且在语言模型竞技场的所有排行榜上都位居第一。 Gemini2.5Flash是我们最高效的工作模型。它因其快速和低成本而受到开发者的极大欢迎。今天,我非常高兴地宣布,我们将发布一个更新版的2.5Flash。新的Flash在几乎每个方面都有所改进,在推理、代码和长文本等关键基准测试中都有提升。实际上,它在语言模型竞技场排行榜上仅次于2.5Pro。我很高兴地告诉大家,Flash将在6月初全面开放,随后Pro也将推出。 我们正在根据你们的反馈进行最后的调整,但你们现在可以在AIStudio、VertexAI和Gemini应用程序中尝试预览版。一如既往,我们致力于持续推动技术的前沿发展,并且对我们的最新研究成果感到兴奋。 TulseeDoshi,GoogleSr.Director&HeadofProduct-GeminiModel 我很高兴与大家分享我们正在创造的改进,以便让像你们这样的开发人员更容易使用Gemini2.5,所有这些改进都是基于你们的反馈,包括提升的能力、增强的安全性和透明度、更好的成本效率以及更多的控制。 首先,除了提到的新版2.5Flash外,我们还推出了文本到语音的新预览版。这些版本现在首次支持多说话人,可同时处理两种声音,并基于原生音频输出。这意味着该模型可以用更具表现力的方式进行对话。它可以捕捉我们说话时非常细微的差别。它甚至可以无缝切换到耳语。这适用于24种以上的语言,并且可以轻松地在语言之间切换。因此,该模型可以用英语开始说话,然后切换到另一种语言,再切换回来,全部使用同一种声音。 从今天开始,你可以在GeminiAPI中使用这种文本到语音功能。直播API也将在今天晚些时候推出2.5Flash预览版的原生音频对话功能。因此,你可以直接使用更具自然感的Gemini构建对话体验。它甚至能够区分说话者和背景声音,因此知道何时做出回应。 其次,我们加强了对安全威胁的防护,例如间接提示注入