AI处理器的真正本质 By Dennis LaudickVP of Product Management 产品管理副总裁 2025年4月 AI处理器的真正本质 围绕AI存在许多困惑和炒作。如今,科技行业的几乎每一项服务、产品或领域都被贴上了AI的标签。其中许多确实是合理的,毫无疑问,AI正在为各行各业带来新的能力和更高的生产力。 然而,在太多情况下,与AI的关联可能是牵强的,甚至在最糟糕的情况下完全具有误导性。本文对AI及其相关硬件选项进行了分类,特别聚焦于设备端(即边缘)AI,为读者提供了实用的背景知识,帮助大家更好地理解聚焦AI的新一波热潮(有时是炒作)。 AI处理器的真正本质 你所说的AI是什么意思? 虽然在半导体行业中,AI这个词还处于相对初期的阶段,但这项技术已经足够先进,对其进行细分是有帮助的。理解一些基本的AI概念包括: 云端AI:当计算发生在设备之外的数据中心或远程桌面时。前沿的AI算法(有时称为基础模型)通常首先在云端诞生,且云端依然托管着最复杂的AI应用,即最准确和高性能的生成式AI工具。这些应用通常涉及高度复杂性,并且对计算资源的需求超出了单一设备或个人电脑所能提供的范围。 边缘AI:当AI算法在云端环境中被证明是可行的,它们通常会进入一个优化阶段,这个阶段旨在减少算法的计算需求,同时保持可接受的准确性水平。这一阶段的结果就是边缘AI:一种可以在资源受限(无论是功耗、内存还是成本方面)的设备上实际运行的算法,比如手机、汽车、无人机或相机。边缘AI的应用范围非常广泛,从高度优化的生成式AI或大型语言模型到用于计算机视觉的卷积神经网络(CNN),甚至是可以用来学习像手表电池消耗模式这样简单事物的小型网络。 AI训练:是创建AI模型以满足特定用例的初始过程。几乎所有方法都涉及到构建大量“节点”形成复杂的矩阵关系(或网络),然后通过它传递大量的样本数据进行“训练”,例如,让模型处理100万张猫的图片,以便让它“学习”在这个模型中猫的样子。训练通常由数据科学家在云端环境中完成,而且往往涉及极其庞大的数据量和数据处理工作(例如,据报道ChatGPT-4的训练成本超过了1亿美元)。近年来,轻量级训练也可以在边缘进行,以支持私人设备上的AI。 AI处理器的真正本质 AI推理:比训练要简单得多,且计算成本低得多。它是将新的激励输入预训练模型并要求其执行任务的过程。在猫识别的例子中,你将一张新图片传入模型,它只是给出图片中有猫的概率。大多数边缘AI(以及一般意义上的AI)都是推理。 不断演化的AI模型和技术生命周期 仅仅十年前,卷积神经网络(CNN)在AI领域风靡一时,并完成了在计算机科学领域此前认为极其困难的事情,比如,在图片中识别猫!然而,通过使用CNN和循环神经网络(RNN),语音识别和图像识别现在已经实现了超过99%的准确率,之后技术人员和学者们将他们的注意力转向了资源优化。几乎每周都会有大量文章介绍人们如何以原先1/10、1/100甚至1/1000的功耗和处理能力实现相同的功能和准确性。 这一过程贯穿了整个技术历史。重大突破通常最初是昂贵的,但一旦证明可行,它们就可以随着时间的推移被优化,以更少的资源实现相同的结果。这种能力飞跃和资源优化的循环将会永远重复下去。 在CNN之后不久,Transformer模型出现并革新了生成式AI;此后,扩散模型也作为一种对生成任务极具潜力的解决方案出现。这些较新的模型现在正在被优化以更高效地运行,既为了节省云AI用例的运营成本,也为了使它们能够在边缘的各种设备上运行。AI模型领域仍处于早期阶段,并持续定期带来惊人的突破。 AI处理器的真正本质 通用AI硬件 现在我们对AI的一些理论概念有了大致了解,让我们开始讨论运行它所需的硬件。首先我们需要回顾“前AI”时代的计算方式以及不同类型通用处理器的演变。 顺序处理 传统上,计算是在所谓的标量或顺序处理器上完成的——最常见的是中央处理器(CPU)。简单来说,这些处理器执行一个动作,完成后继续下一个动作。它们非常易于理解,几乎可以用于任何类型的计算。历史上,随着软件变得越来越复杂,CPU只是变得越来越快。 然而,CPU的顺序计算方法有一个局限性:它一次只能做一件事,有些任务并不适合这种方式。 并行处理的诞生 并行处理的概念被发明出来以加速那些CPU不擅长的任务。并行处理将非常大的工作负载分解成许多小的独立工作负载,这些负载可以同时运行。 其中一个最早需要并行加速的任务是像素处理。图形用户界面或电脑游戏需要每秒至少计算屏幕上数百万个像素30次。这是CPU根本无法足够快速完成的。然而,很明显,如果每个像素的数据能够独立并行计算,那么所需的性能就能达到。这就是首个图形处理器单元(GPU)诞生的原因。如今,从桌面到智能手表,几乎所有带有屏幕的设备都配备了GPU。 最初,GPU的功能非常有限。然而,随着时间的推移,随着用户界面变得更加丰富,游戏场景变得更加详细,每个像素都需要更复杂的处理才能达到正确的结果。为应对这种情况,GPU成为了高度灵活、高度可编程、通用且并行的计算加速器。它们的灵活性意味着不仅可以运行图形相关的软件,还可以以高度并行化且高效的方式运行其他软件。 AI处理器的真正本质 顺序处理的局限性 现代计算机科学的一个挑战是,近年来,CPU设计者和半导体技术专家不断专注突破 提升CPU性能瓶颈,然而软件却变得越来越复杂! 就在CPU性能飞跃开始放缓的时候,AI出现了。正如前文所述,AI本质上涉及复杂的矩阵或网络,其中包含大量的“节点”(截至撰写时可能达到数百亿个,并且增长迅速)。对所有这些“节点”进行顺序计算,仅适用于最简单的AI网络。 为了解决这个问题,许多CPU采用了诸如矢量引擎之类的特殊适配功能,这可以在一定程度上帮助处理AI工作负载。但它们仍然受到处理器本身的限制:CPU本质上是顺序执行的,根本无法应对AI所需的高带宽数据和庞大的计算量。在CPU上运行大多数AI软件意味着需要长时间等待响应,同时伴随着极高的功耗。CPU能够支持的AI能力存在实际限制。 并行处理来拯救! 然而事实证明,在大多数情况下,AI网络中的一个“节点”与屏幕上的一个像素有许多相似之处:它们可以被独立并行运行,由一组定义明确的计算组成,并依赖于巧妙的数据管理。这种像素与节点之间的相似性,加上现代GPU的高度可编程性和灵活性,意味着只需进行一些有针对性的修改,GPU就成为运行AI网络的理想工具。 并非所有GPU都相同 认识到这一点后,云端AI已经主要基于GPU。用于云端AI训练的GPU能够处理极其复杂的网络,无论其形状、大小或描述如何,均由程序员自行决定。它们还处理几乎难以想象的海量训练数据。因此,这些GPU的设计主要以最大灵活性和最高原始性能为目标。为了实现这一目标,它们可能非常庞大,并且通常位于数据中心中,拥有充足的电力、冷却能力和数据带宽。即使在最强劲的情况下,完成一次训练课程仍可能需要大量数据中心GPU花费数天、数周甚至数月的时间,并消耗兆瓦级的电力。 另一方面,边缘AI推理提出了完全不同的挑战。设备端AI推理所需的GPU无法依赖蛮力性能,因为这些处理器更小,且在可用功率和内存方面受到更多限制。它们需要比云端GPU更智能、更高效,才能发挥现代AI的性能优势,而不会耗尽手机电池或显著影响电动车的续航里程。 幸运的是,嵌入在手机和汽车等设备中的现代GPU已经经过了数十年的优化,能够在低功耗下高效执行数据密集型工作负载——考虑到所涉及的处理水平,这是一个巨大的成就。它们完全有能力满足边缘AI推理的需求。 AI处理器的真正本质 那么NPU或AI处理器呢? 仅仅关注CPU和GPU并不能完整描绘AI硬件的全貌。还有神经处理单元(NPU),有时也被称为AIPU或其他类似的“大脑”或“智能”术语。 NPU完全没有标准化,形式五花八门。有些非常奇特(如神经形态计算或内存类计算),有些针对特定AI网络进行了高度优化,还有一些具备一定程度的灵活性。 然而,几乎所有NPU都会遇到以下一个或多个可编程性挑战: 它们本质上是专有的。没有统一的NPU设计方法,这使得第三方软件开发者难以使用。 缺乏标准软件接口和工具,这使得它们难以编程。 通常针对特定类型的AI网络或一类网络进行了优化。这意味着虽然它们在这些特定网络上效率很高,但在新AI网络出现时难以适应。在快速发展的AI世界中,它们的生命周期可能很短。 缺点,这意味着在一个NPU上运行良好的软件在另一个NPU上可能表现不佳。 即使存在这些可编程性问题,NPU仍有其用武之地。它们最好被视为专用硬件加速器。如果你有一个已知的工作负载,并希望尽可能快或高效地运行它,专用硬件加速总是能带来最佳结果。 然而,在当前AI工作负载逐年变化的情况下,AI硬件系统仍需要一定程度的灵活性和通用加速能力,以确保设备的未来适用性。 AI处理器的真正本质 别忘了软件 AI硬件和软件密不可分。在创建AI解决方案时,可能会倾向于将这两个领域分开,让它们各自解决自己的问题空间。但如果这两个组件不能结合在一起,你将一无所获。 在创建AI硬件平台时,至关重要的是要考虑它需要运行什么软件以及谁将开发这些应用程序。这是专用硬件加速器的一个主要弱点:它们过于专注于特定任务,通常缺乏使它们对更广泛的软件社区有用的配套软件和工具。 软件是通用处理器的超级力量。它们都配备了基础层、标准接口和高级工具,使硬件和软件世界能够结合在一起,让魔法实现。 这也是CPU的优势所在——它们拥有近半个世纪的软件生态系统开发历史。尽管GPU的软件生态系统较年轻,但也足够成熟,使AI开发者能够轻松利用其并行性。有大量定义明确且被广泛接受的软件标准,例如oneAPI、OpenCL、SYCL和TVM,使开发者能够将GPU用于AI。此外,分析、跟踪和调试工具也正在迅速适应,以覆盖AI工作负载,而不局限于传统的图形处理。 并行处理的时代 随着AI渗透到所有设备中,越来越多的并行处理器被集成到硬件系统中。未来的发展轨迹似乎十分清晰:未来的边缘AI硬件将包括一个用于控制任务的通用顺序处理器(CPU)、一个用于灵活图形处理和AI编程的通用并行处理器(GPU),以及在需要时,一个用于预定AI功能的专用硬件加速器(NPU)。 这种将多种不同类型的处理器整合到一个系统中的方法被称为“异构计算”,并且已经在边缘设备中使用了多年。不过,停滞不前的CPU性能与不断增长的AI工作负载正推动GPU被广泛应用于异构边缘系统中。GPU的并行性为软件社区所需的边缘AI硬件提供了高性能、可编程性和能效。 AI处理器的真正本质 作者简介 文章由 Imagination Technologies 的产品管理副总裁 DennisLaudick 撰写,他致力于为人工智能领域带来清晰的认识。文章基于他在移动、汽车和消费电子行业数十年的经验总结而成。在加入Imagination Technologies 之前,Dennis 曾在 Arm 担任汽车、人工智能和 GPU 部门的多个领导职位。在此之前,他还曾就职于其他领先的半导体和 OEM 公司。他曾设计并推向市场多代 GPU 以及四代 AI 处理器,其中包括 Imagination 最新一代的 GPU。 imaginationtech.comContact us now