登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
智能体安全研究报告:从大模型安全到可控行动系统
信息技术
2026-06-09
-
清新研究团队
周振
核心判断
Agent 安全边界比聊天机器人大得多
:Agent 是有权限的运行时系统,能规划、调用工具、保持状态并影响外部系统,安全目标不是让模型不犯错,而是让错误不无约束扩散。
安全抓手
:身份、权限、工具、上下文、沙箱、审批和审计。
风险本质变化
:从“内容风险”升级到“行动风险”,Agent 的主要问题是能否代表用户或系统采取行动。
企业战略含义
:Agent 能力会商品化,但安全部署能力不会自动商品化,可规模化的权限、审计、评测和事故响应是组织能力,越早建立控制平面,越能更快释放 Agent 价值。
官方背景与定义边界
CISA/NSA
:将 Agent 列入安全议题,强调分层防御、严格访问控制、人类监督和渐进式部署,“Careful Adoption”成为企业落地的重要参考。
NIST
:明确区分普通聊天机器人与行动型智能体,关注能改变外部状态的 Agent systems,为企业风险分级提供清晰边界。
OpenAI
:Agent 是多步骤工作应用,规划、工具调用、协作和状态保持构成 Agent 基本能力,沙箱执行成为 Agent 基础设施。
MCP 背景
:连接能力提升也扩大攻击面,协议让工具接入更容易,但不自动保证安全!
安全从“模型层”转向“运行时层”
Agent 风险发生在模型生成和工具执行之间,工具调用、数据流、身份授权和日志追踪决定生产风险,运行时层是 Agent 安全的主战场。
Agent 不是员工,但必须像数字员工一样管理:需要岗位、权限审批和绩效。
企业常见误区
把智能体当成“更强客服机器人”会低估风险。
忽视工具调用和数据操作的风险。
先接业务系统,后补审计和审批。
智能体系统的最小组成
Agent 运行闭环
:Agent 不是一次性回答,而是循环执行,每一步都会读取新上下文并产生新动作,循环越长,越需要熔断和阶段性确认。
身份层
:Agent 必须有独立身份和代理链路,每次工具调用应记录用户、Agent、服务账号和审批链。
权限层
:权限按任务授予,而不是按用户全量继承,只读、草稿、半自动、自动执行应分级,高风险动作需要审批或独立验证。
工具层
:每个工具需要描述、schema、权限、风险标签,工具返回内容不能自动变成高优先级指令。
上下文层
:不可信数据必须被标记和隔离,上下文应区分指令、用户意图和普通数据。
记忆层
:长期记忆会把一次攻击变成持续偏差,记忆写入需要规则和可见性,记忆必须支持版本、删除和回滚。
沙箱层
:代码、文件和命令操作必须隔离,默认关闭不必要的网络和宿主机访问。
审计层
:记录每次工具调用、参数、结果、(批准人和时间,事故后能回放决策链并定位责任。
人工层
:高风险动作必须停下来审批,审批记录进入 Action Ledger。
核心风险地图
八类风险
:目标劫持、工具滥用、身份滥用、记忆污染、上下文投毒、沙箱逃逸、供应链污染和多 Agent 级联失败。
高风险场景
:资金、医疗、法律、身份权限和生产变更,客户外发和公开发布,低风险任务先行,高风险任务后置。
宏观威胁环境
:外部攻击压力正在上升,FBI 2025 报告显示网络犯罪报告损失超过 200 亿美元,NIST 2026 说明 2025 年 NVD 丰富近 42,000 个 CVE。
控制平面总览
统一管理
:身份、工具、策略、审计和评测,AgentSafetyControlPlane 是横向基础设施。
Agent Registry
:登记每个 Agent 的 Owner、模型、工具、权限、数据域和风险等级。
工具注册中心
:每个工具声明用途、schema、权限、审批等级和失败模式。
策略引擎
:在工具调用前检查身份、任务、数据和动作。
最小权限
:按任务授予短期权限。
上下文防火墙
:DLP 与数据最小化。
沙箱执行
:强工具必须在隔离环境中运行。
人工审批门
:高风险动作必须停下来审批。
Action Ledger
:记录任务目标、上下文来源、工具调用、参数、结果和批准人。
评测总览
注入红队
:模拟网页、邮件、PDF 和工具输出中的恶意指令。
工具调用评测
:每个工具都要有安全测试。
数据泄露评测
:测量外发、摘要、日志和工具传输中的泄露。
记忆污染评测
:构造含敏感字段的上下文和诱导请求。
沙箱逃逸评测
:代码工具必须承受对抗测试。
运行监控
:监控工具调用频率、异常拒绝、数据外发和高风险审批。
事故响应
:建立事故响应机制。
治理模型
风险分级
:不同 Agent 进入不同上线通道,数据敏感度和动作不可逆性共同决定风险等级。
安全开发流程
:建立安全开发流程。
采购与供应商管理
:审查第三方 Agent 的模型、数据处理、工具权限、日志可得性和事故通知。
组织能力
:Agent 安全需要跨团队协同。
成熟度模型
建立成熟度模型评估 Agent 安全能力。
90 天和 180 天路线图
90 天目标
:形成 Agent 安全控制平面,核心 Agent 接入统一控制平面。
180 天目标
:高风险场景有独立评估和事故演练,安全指标纳入业务 Agent 绩效。
最终判断
有了权限、工具、沙箱和审计,Agent 才能进入生产。
安全不是 Agent 的刹车,而是规模化的发动机,没有安全控制,Agent 只能停留在小范围实验。
你可能感兴趣
AI编程行业深度研究报告:从代码补全到智能体时代(2026年4月)
信息技术
解数咨询&D17
2026-04-20
2023从设计安全到内生安全技术白皮书
信息技术
紫金山实验室
2024-01-15
DeepSeek系列专题线上公开课(第二季):从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例
信息技术
浙江大学
2025-03-24
浙江大学:从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例
文化传媒
肖俊
2025-03-04
浙江大学DeepSeek系列专题线上公开课(第二季) 从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例
信息技术
人工智能省部共建协同创新中心(浙江大学)
2025-03-01
基础智能体的进步与挑战:从类脑智能到进化、协作和安全系统
MetaGPT&蒙特利尔大学&香港科技大学
2025-03-31
2026AI安全产业核心洞察:从“模型护栏”到“智能体生态治理”的系统级转型
信息技术
数说Social Research
2026-07-15
Hermes Agent 深度研究报告 从大模型助手到可执行智能体:能力、架构、场景与趋势
信息技术
清新研究团队
2026-04-09
大模型系列报告(三):从“思考”到“行动”的系统级重构
信息技术
财通证券
2025-12-16
从安全到暴露:人工智能如何重新绘制工作地图
科法斯
2026-04-01