作者yeasy版本1.0.0⽇期2026-08-18 ⽬录 智能体AI权威指南 本书⽬标5你将学到什么5读者对象5学习路线图6高管决策路线6快速开始6下载离线版本7推荐阅读7参与贡献7许可证7 第⼀章智能体范式⾰命 学习⽬标8章节地图81.1从⼤模型到智能体91.2智能体理论基础131.3核心组件:⼤脑、感知、⾏动与记忆161.4智能体的认知层级191.5智能体⼯作流21本章⼩结25 第⼆章推理、规划与提⽰词⼯程 学习⽬标26章节地图262.1思维链与线性推理272.2任务分解与规划算法322.3 ReAct:推理与⾏动的统⼀352.4反思与⾃我修正412.5智能体提⽰词⼯程46本章⼩结25 第三章记忆系统与上下文⼯程 学习⽬标52章节地图523.1记忆的认知模型533.2短期记忆管理573.3⻓期记忆与向量数据库633.4智能体中的RAG系统设计703.5图记忆与知识图谱733.6上下文⼯程78本章⼩结25 第四章⼯具使⽤与环境交互88 学习⽬标88章节地图884.1⼯具使⽤概述与分类894.2⼯具使⽤机制954.3⼯具连接协议:模型上下文与⼯具服务1024.4智能体技能:能⼒扩展规范1054.5浏览器⾃动化与计算机操作1114.6多模态能⼒1204.7智能体交互体验:人机交互接⼝126本章⼩结25 第五章多智能体协作模式130 学习⽬标130章节地图1305.1协作架构:层级、扁平与动态1315.2⻆色分⼯与SOP流程编排1365.3动态组队与⾃适应编排1395.4人机协作143本章⼩结25 第六章通信与社会模拟 学习⽬标151章节地图1516.1智能体间通信协议设计1526.2⽣成式社会模拟:斯坦福⼩镇解析1576.3博弈论视⻆下的冲突解决1616.4涌现⾏为与集体智慧1656.5智能体间互操作协议170本章⼩结25 第七章学习、评估与进化178 学习⽬标178章节地图1787.1从反馈中学习:RLHF与RLAIF1797.2评估体系:AgentBench与基准测试1847.3轨迹分析与⾏为可解释性1957.4持续学习与知识更新2017.5推理能⼒的提升:从快速响应到深度思考204本章⼩结25 第八章开发框架全景 学习⽬标214快速选型参考214章节地图2148.1框架⽣态概览与选型指南2158.2从链到图:流程编排进化2178.3数据驱动的RAG框架2218.4多智能体协作:多智能体框架实战2258.5企业级集成:与现有系统整合2288.6平台级产品:接⼝原语与托管运⾏时2318.7框架性能基准评测234本章⼩结25 第九章AgentOps与⽣产化落地239 学习⽬标239章节地图2399.1设计模式:从Workflow到智能体2409.2 Harness架构:智能体的执⾏与治理层2479.3可观测性与调试2549.4性能优化与成本控制2609.5企业级智能体平台:架构、安全与治理2669.6故障模式与韧性设计2729.7架构陷阱与反模式2769.8从实验到⽣产:决策路线图与检查清单2839.9智能体⾃主度实证分析与监控2939.10智能体还是⾃动化:为需求匹配最简形态297本章⼩结25 第⼗章智能体编程实践 学习⽬标300章节地图30010.1编程范式转移30110.2智能体编程原理30910.3常⻅⼯具32210.4开发方法论32610.5⼯程化实践333本章⼩结25 第⼗⼀章安全、伦理与未来345 学习⽬标345章节地图34511.1安全边界:提⽰词注入与防御策略34611.2价值对齐与⻛险控制35811.3智能体的法律与伦理边界36311.4迈向通⽤人⼯智能368本章⼩结25 第⼗⼆章附录 章节导读374如何使⽤本附录37412.1术语表37512.2推荐论文与阅读清单37912.3 AGENTS.md规范指南38212.4案例模板与检查清单38912.5快变事实核验表395 智能体AI权威指南 人⼯智能正在经历⼀场范式⾰命。当对话式⼤模型广泛普及时,世界惊叹于它们的涌现能⼒;⽽今天,我们正站在⼀个更具历史意义的转折点——从“能对话的AI”迈向“能⾏动的AI”。智能体AI(Agentic AI)的崛起,标志着人⼯智能从被动响应⾛向主动规划、从单轮交互⾛向持续协作、从辅助⼯具⾛向⾃主伙伴。这不仅是技术演进,更是人机关系的根本重塑。 《智能体AI权威指南》正是为这⼀时代⽽⽣。本书将带你深入智能体技术的核心,从底层原理到架构设计,从主流框架到⼯程实践,构建完整的知识体系,助你把握这场变⾰的脉搏。 本书⽬标 本书致⼒于帮助研究人员、⼯程师、技术专家以及AI爱好者: 理解核心概念:深入剖析智能体AI的基本原理,包括感知、规划、记忆和⾏动。掌握架构模式:学习ReAct、规划与执⾏等主流设计模式,以及多智能体协作架构。熟悉开发框架与⽣态:理解“链式编排”“图式编排”“数据驱动的RAG框架”“多智能体编排”等常⻅路线与选型思路。落地最佳实践:提供从设计、开发到评估、安全治理的全链路⼯程实践指南。 你将学到什么 通过阅读本书,你将建立起完整的智能体AI知识地图: 1.单体智能篇:了解智能体的诞⽣原理,掌握其⼤脑(规划)、记忆与⼯具使⽤机制。2.群体智能篇:探索多智能体协作(Multi-Agent)、通信协议与社会模拟等高阶话题。3.进化学习篇:深入强化学习(RLHF)、评估体系与智能体⾃我进化能⼒。4.⼯程实践篇:以典型⼯程场景为主线,掌握AgentOps落地心法与Agentic Coding编程新范式。5.未来展望篇:洞察安全伦理边界,展望通向AGI的技术路径。 读者对象 想从LLM调⽤迈向智能体开发的⼯程师:已经熟悉⼤模型API,但不知如何让模型“动起来”、真正解决端到端任务。正在选型或落地智能体框架的技术负责人:⾯对多种技术路线与产品形态,需要深入理解各类框架的设计哲学与适⽤场景。评估AI战略投资的企业高管:需要理解智能体技术的商业价值、落地路径与⻛险边界,做出明智的资源配置决策。关注AI产品下⼀步演进方向的产品人:希望理解智能体能⼒边界,为产品规划提供技术视⻆。对前沿AI技术保持好奇的研究者与⼤学⽣:期望系统性理解智能体架构原理,⽽非碎⽚化的教程。 前置知识:本书假设读者对AI和⼤语言模型有基本了解。如果你是AI领域的新⼿,建议先阅读《零基础学AI》建立基础概念。如果你希望先掌握提⽰词⼯程,推荐阅读《⼤模型提⽰词⼯程指南》。 开启智能体未来探索之旅! 模型可⽤性、API、协议和基准等高波动内容统⼀收录在快变事实核验表,并按30天有效期复核。正文出现冲突时,以该表引⽤的最新官方来源和冲突状态为准。 高管决策路线 这条五站路线把技术⾃主性转换为可审计的投资与治理决策;每⼀站都有明确输入和输出,可由测试验证链接与顺序。 1.定义可接受的⾃主度与升级边界:确定授权层级、人⼯接管点和成功指标。2.建立成本、性能与ROI基线:⽤真实采样评估单位经济性,⽽不是⽤演⽰效果外推。3.落实企业治理与运⾏责任:把权限、审计、合规和事故响应绑定到负责人。4.设计可理解、可撤销的人机体验:验证⽤户是否看得懂、控得住并能安全接管。5.审查对齐与⻓期外部性:在扩⼤⾃治范围前复核⽬标偏移、滥⽤与系统性⻛险。 快速开始 在线阅读 👉推荐:GitBook在线版 下载离线版本 本书提供PDF版本供离线阅读,可前往GitHub Releases⻚⾯下载最新版本。 如需获取默认分支⾃动更新的预览版,可直接下载agentic_ai_guide.pdf。该文件会随主线更新覆盖,不代表正式发布版本。 本地阅读 先安装mdPress: brew tap yeasy/tap&&brew install mdpressmdpress serve 启动后访问本地阅读地址即可阅读。 推荐阅读 本书是AI技术丛书的⼀部分。以下书籍与本书形成互补,建议根据需要组合阅读: 参与贡献 欢迎贡献!您可以通过以下方式参与: 🐛提交Issue―报告错误或提出建议📝提交PR―改进内容或修复typo⭐Star本项⽬―帮助更多人发现这本书 许可证 本书采⽤CC BY-NC-SA 4.0许可证。 您可以⾃由分享和演绎,但需署名、非商业使⽤、相同方式共享。 第⼀章智能体范式⾰命 “AI的未来不仅是聊天机器人回答问题,⽽是智能体采取⾏动解决真实问题。” 本章建立智能体的宏观认知框架。你将学习从静态LLM向动态⾃主智能体的演进,理解支撑智能体运⾏的核心理论模型(PEAS、POMDP),拆解四⼤核心组件(⼤脑、感知、⾏动、记忆),以及掌握从L1到L5的认知层级分类。 学习⽬标 完成本章后,你将能够: 1.理解智能体与LLM的本质区别2.掌握智能体的核心理论模型与四⼤核心组件3.评估智能体的认知层级与能⼒边界4.应⽤智能体⼯作流范式优化系统设计 章节地图 本章按照“范式转移→理论基础→核心组件→能⼒分层→⼯作流模式”的顺序展开,先回答“什么是智能体”,再回答“它为什么成立、由什么组成,以及如何落到⼯程设计”。 1.1从⼤模型到智能体 本节将深入探讨从⽣成式AI向智能体AI的演进过程,并剖析⼆者的核心差异——即从单纯的“下⼀个Token预测”转向以“⽬标达成”为导向的能⼒跃迁。 1.1.1从⽣成式AI到智能体AI 在人⼯智能的发展⻓河中,正经历着从“⽣成式AI (Generative AI)”向“智能体AI (Agentic AI)”的深刻转型。如果说“聊天机器人”让⼤众看到⼤模型的对话能⼒,那么“智能体”强调的是能够独立完成任务的⼯作助⼿。 传统的⼤语言模型(LLM)像是⼀个博学的思想家。它阅尽了互联网上的海量文本,拥有关于莎⼠比亚、量子物理和计算机编程的广博知识。如果不给它⼯具、执⾏环境和状态管理,即便是多模态模型,能够理解图像、⽣成语音,它依然主要停留在“输入-输出”范式⾥。它能“看”能“说”,但未必能稳定地“做”。 智能体AI的出现打破了这⼀僵局。通过赋予LLM“⼿”(⼯具)、“眼”(感知)和“记忆”,将这个思想家变成了⼀个能够与物理和数字世界互动的实⼲家。这种范式转移(Paradigm Shift)不仅是技术的升级,更是人机交互模式的根本性变⾰——不再是命令机器“⽣成⼀段文字”,⽽是授权机器“帮我达成⼀个⽬标”。 1.1.2核心差异:从“下⼀个Token预测”到“⽬标达成” 要理解智能体,⾸先要剖析它与LLM的本质区别。 ⽬标导向与概率预测 LLM的训练⽬标是极其单⼀的:根据上文预测下⼀个词元(Token)的概率分布。当你问它“这种药怎么吃?”时,它并不是为了治好你的病⽽回答,仅仅是因为在训练数据中,这样的问题通常伴随着说明书式的回答。 相反,智能体是⽬标导向的。它内置了⼀个核心指令(系统提⽰词):“你是⼀个能够解决问题的助⼿”。当⾯对任务时,它不急于输出词元(Token),⽽是先思考“为了达成这个⽬标,我需要获取什么信息?需要执⾏什么步骤?”。 有状态与无状态 原⽣的LLM是无状态的函数。你的每⼀次请求对它来说都是全新的,它不记得上⼀秒发⽣了什么(除非你把历史对话作为上下文传给它)。 智能体(Agent)维护着持久化的状态。这包括: ⻓期记忆:记得你上周提到的过敏源。任务状态:知道“订机票”的任务⽬前停留在“已搜索航班,等待⽤户确认”的阶段。环境状态:知道当前⽬录下有哪些文件被创建了。 主动循环与单次推理 这是最显著的架构差异。 LLM:输入A ->输出B。线性,⼀次性。智能体:处理(⽬标) ->思考->⾏动->观察->思考-> ... ->最终结果。这是⼀个循环(Loop)。智能体会在⼀个while循环中不断运⾏,直到它认为任务完成或达到最⼤尝试次数。这种“试错-修正”的能⼒,赋予了智能体解决复杂非线性问题的可能。 1.1.3认知升级:系统1与系统2 诺⻉尔奖得主丹尼尔·卡尼曼在《思考,快与慢》中