AI 智能体的崛起与构建
AI 智能体的起
自治代理人的崛起
定义:自治代理是一个系统,位于内部和一部分环境,随着时间的推移,感知环境并对其采取行动,追求自己的议程从而影响未来的感觉。其目标是自主完成来自现实世界场景的任何复杂用户指令,系统可以像人类一样完成用户目标,执行各种动作,模仿人类行为以解决复杂任务,并模拟人类在现实环境中的感知、交互和反馈行为。
自治代理人为何崛起:主要归因于大型语言模型(LLM)的崛起。从2022年ChatGPT的出现到2023年3月HuggingGPT、AutoGPT、VisualChat GPT、AgentGPT、BabyAGI、LLAMA等模型的相继问世,以及2023年8月G精力充沛 Agent、SuperAGI、ChatDev、MetaGPT等模型的推出,LLM的进化技术推动了从LLM到代理的转变。
LLM vs 代理商:代理设计基于基础模型(如大规模语言模型或超大规模语言模型)构建,并将其能力扩展到现实世界的应用场景中。
如何构建智能体
拥抱 GPT
背景:AGI意味着agent/AI应该像人类一样思考,以解决未来任何复杂的AI任务。然而,LLM仍存在一些限制:主要应用于处理文本数据,缺乏处理复杂资讯(如视觉和语音)的能力;需要详细的任务规划,而当前LLMs的能力范围有限;在零样本或少样本设置中表现出色,但在某些专家模型面前仍然相对较弱。
动机:通过结合语言作为界面,LLMs可以被视为大脑管理AI模型(如规划、调度、合作),从而桥接LLM和外部模型之间的连接。
Example:通过设计功能指南指令,LLM可以更有效地使用工具。
EasyTool
背景:构建基于LLM的代理通常需要开发许多提示,带来大量令牌消耗;扩展AI代理的任务范围需要连接大量额外工具,并输入许多工具文档,效率低下;工具文档可能不一致、冗余和不完整。
解决方案:EasyTool通过重新组织原始工具文档,删除无关信息,仅保留功能指南说明,并设计功能指南指令以供LLM使用,提高效率。
EvoAgent
背景:现有的代理系统严重依赖手工设计,限制了其可扩展性和功能。
解决方案:EvoAgent通过进化算法自动将代理扩展到多代理系统,将代理生成公式化为进化算法,每个代理被视为能够在其多代连续世代中繁殖其种群的个体,系统设置(如角色、技能、提示)被视为进化的变量。
结果:EvoAgent可以大大提高NLP知识和推理任务中的LLM性能,并在每个LLM之间提供一致的改进;可以推广到现实世界的场景,支持制定不同的计划策略以满足不同的用户偏好。
如何评估智能体
TaskBench
背景:使用基于LLM的代理处理用户请求的过程可以被视为任务自动化,但衡量LLM在任务自动化中的能力面临挑战:如何分析用户请求并将其分解为可能的任务?如何为每个可能的任务选择最合适的解决方案?如何确定每个解决方案的参数?
解决方案:TaskBench通过反向指示进行分析和评估。
未来
观点:自动代理可以被视为AGI的一种预览形式;代理的增长归因于LLMs emergent 的能力;代理设计应当满足通用性、多样性以及实践性(praxology);提高基础模型、组件(如规划、工具、记忆)和环境将提升代理性能;如何支持AI Agent的持续增长/进化?如何为AI Agent建立社区?如何部署可控、可操纵的AI Agent?