Agentic AI概述
Agentic AI是下一代生成式AI技术的核心范式,超越了传统AI的被动响应模式,赋予AI自主规划、记忆、工具调用及协作能力,使其能够像人类一样主动理解、分解并解决复杂问题。Agentic AI的核心能力包括:
- 通用语言的理解能力:通过大语言模型理解人类用自然语言表达的复杂任务描述,无需进行专门的编程以及定义规则。
- 强大的推理能力:利用大语言模型预训练获得的广泛知识和推理能力,进行因果推理,并在新的上下文环境中应用已经构建的知识。
- 自主规划能力:结合思维链(Chain-of-Thought, CoT)技术,将复杂任务自行分解为子任务,并对这些子任务进行有序规划和执行。
- 工具使用能力:通过函数调用(Function Calling)的能力,识别何时需要调用函数,并正确构造API调用参数,使用外部工具来完成任务。
Agentic AI的飞跃发展得益于技术的进步、性价比的提升、安全可靠的数据基础设施以及先进的开发工具。根据Gartner的预测,到2028年,企业软件应用中将有33%集成Agentic AI功能,日常工作决策中的15%将由Agentic AI系统自主完成。
Agentic AI的技术原理
现代Agentic AI系统通常由四个核心组成部分构建:
- 大型语言模型作为推理引擎:负责自然语言理解、推理与决策、预训练阶段获取的广泛世界知识的应用、对话历史维护等。
- 规划能力:利用思维链(Chain-of-Thought, CoT)技术,将复杂任务自行分解为子任务,并对这些子任务进行有序规划和执行。
- 记忆机制:包括短期记忆和长期记忆,用于存储和检索过去的交互信息、知识和经验,实现上下文感知的连续对话和长期学习。
- 工具使用:通过调用外部提供的API接口来完成对各种工具的使用,执行相关操作并访问实时信息。
Agent的分类
Agentic AI系统可以根据交互模式和自主程度进行分类:
- 基于交互模式分类:
- 单Agent:以单个Agent为核心处理单元,适用于特定领域的任务场景、任务步骤清晰且相对固定的应用场景,需要快速响应且不需要复杂协作的场景。
- 多Agent:由多个协作的Agent共同组成,每个Agent负责不同的任务或领域,通过协作共同完成复杂的问题解决过程,适用于需要多种专业知识协作的任务、需要多个步骤和决策点的复杂业务流程、需要多角度思考的场景。
- 基于自主程度分类:
- Agentic Workflow(Agent工作流):预定义包含了步骤序列工作流,Agent仅在预设的决策框架内做出选择,适用于具有明确步骤和决策点的流程、需要可预测性和可审计性的场景、任务复杂度相对较低的应用、以及需要低延迟和高效率的场景。
- Autonomous Agent(自主Agent):能够根据设定的高级目标自行规划、决策并执行复杂任务,适用于需要考虑多种因素和权衡不同选择的场景、环境或要求经常变化从而需要灵活适应新情况的场景、需要创造性思维和非常规解决方案的问题、以及需要理解并响应复杂人类意图的交互场景。
Agentic AI的技术栈
Agentic AI技术栈由多个不同的技术组件组成:
- Agent框架(Agent Framework):提供创建和定义Agent的基本结构、任务管理、环境交互、记忆和状态管理、决策引擎、工具集成、多Agent协作、监控和日志、安全和控制机制、可扩展性等功能。
- Agent托管(Agent Hosting):将Agent部署至本地服务器或云端基础设施,实现内外部系统的便捷调用与无缝访问。
- 模型服务(Model Serving):通过推理引擎将大语言模型封装成可通过API访问的服务单元,降低Agentic AI应用开发的技术门槛与资源投入。
- 记忆(Memory)管理:包括传统数据库、向量数据库与语义搜索、知识图谱(Knowledge Graphs)等,用于存储和检索过去的交互信息、知识和经验。
- 沙箱环境(Sandbox):提供隔离环境,限制Agent的自主行为所带来的潜在危害,对Agent的执行进行风险管理。
- MCP(Model Context Protocol):建立大模型与数据存储系统之间的统一连接协议,为Agentic AI提供一种与工具、服务和数据连接的一致方式。
Agent 技术延展
Agentic AI技术也诞生了多种前沿的领域:
- MCP(Model Context Protocol):为Agentic AI提供一种与工具、服务和数据连接的一致方式。
- Computer Use技术:使AI能够像人类一样操作计算机,通过视觉理解屏幕内容,并通过鼠标和键盘交互执行复杂任务。
- Browser Use技术:使Agentic AI能够有效地导航和与网络进行交互,像人类一样浏览网页、填写表格、提取信息,甚至完成复杂的网络任务。
- Agent2Agent(A2A)协议:实现不同Agent系统之间的通信和互操作性,允许基于不同框架或由不同供应商构建的Agent发现彼此的能力,协商交互模式,并互相协作完成任务。
Agentic AI的应用形态
Agentic AI主要有两种应用形态:
- 通用Agent:能够执行各种通用任务的Agent系统,不局限于特定领域,而是能够处理多种类型的请求和任务。通用型个人助手是典型的通用Agent。
- 垂类Agent:专注于特定领域的任务和服务,为特定行业或功能量身定制的智能系统,基于特定领域的数据、工作流程和标准构建,能够精确地执行复杂的现实世界任务。
构建 Agentic AI 应用
构建Agentic AI应用时,应专注在Agent所处的环境、Agent能使用的工具和给Agent的基本指令,可以先实现一个最低功能的版本,然后根据实际效果和反馈逐步改进完善。在选择Agentic Workflow(Agentic工作流)或者Autonomous Agent(自主Agent)构建时,需要综合考虑任务的确定性、对错误的容忍度、灵活性的需求、复杂性以及用户交互的多样性等因素。
应用 Agentic AI 技术进行构建的客户案例
- 金蝶国际软件集团:利用Amazon Bedrock Agents构建智能提单系统和智能指标分析系统,以自然语言交互简化用户提单,优化智能指标查询业务流程。
- 一级方程式赛车(F1®):利用Amazon Bedrock Agents和Amazon Bedrock Knowledge Bases开发了智能根因分析(RCA:Root Cause Analysis)助手,从而实现了用自然语言交互式进行问题的诊断。
总结和展望
Agentic AI代表了人工智能领域的一次重大飞跃,它不再局限于被动响应指令,而是能够主动感知环境、制定目标、规划行动并自主执行复杂任务。通过结合大型语言模型(LLM)、多模态感知、强化学习和自动化工作流技术,Agentic AI能够以更接近人类决策的方式运作,从而在各行各业都展现出来巨大潜力。Agentic AI的未来应用场景也将更加广泛,它将在未来深刻地改变我们的工作方式、商业模式和社会结构。