张华的研报分析了AI技术变革带来的新生隐患,特别是大模型的风险组成结构。大模型的安全风险主要分为模型本体、运行环境和应用场景三个层面。
大模型的安全风险结构:
- 模型本体安全:包括敏感信息泄露风险(如越狱攻击输出受控内容)、prompt指令数据泄漏等。
- 运行环境安全:涉及开发框架风险(如框架漏洞)、开放数据集及训练工具风险、污染的开放数据集风险等。
- 应用场景安全:包括应用开发安全风险(如编码规范、风险开源组件)、应用服务风险(如API攻击、web服务攻击、DDoS攻击)、业务安全风险(如批量注册、恶意引导、内容爬取)等。
大模型运行环境安全:
- 开发框架风险:框架漏洞(包含组件漏洞)。
- 开放数据集及训练工具风险。
- 污染的开放数据集风险。
大模型本体安全:
- prompt指令数据泄漏。
- 基础设施自身的安全性:操作漏洞风险、计算资源泄露。
- 基础设施运维安全性:误操作、违规操作。
随着2026年金融行业全面迈入大模型应用阶段,传统的IT基础设施正在向AI Infra演进,面对急剧扩大的攻击面,金融机构亟需从战略高度重构安全体系。
大模型安全风险具体表现:
- 训练数据投毒、隐私数据泄露及非授权访问模型安全风险。
- 恶意提示词注入与越狱攻击(>50%提示词注入与越狱攻击)。
- 基础设施风险:模型输入输出端建立双向过滤机制,实时拦截恶意提示词注入,并对敏感输出进行脱敏与阻断。
- 供应链风险:内部员工违规操作违规向公共大模型上传企业敏感数据。
- 合规与伦理风险:违反数据出境规定及生成式AI监管合规要求。
基于MECE原则,大模型及AI应用的风险构成:
- 模型输出包含训练集中的敏感数据。
- 黑盒决策无法满足金融监管。
- 微小扰动导致模型产生严重后果。
- 引入包含后门的第三方组件库。
- 算力资源被非法占用或横向Api接口鉴权。
- 跨境数据违规传输。
- 数据污染。
- 提示词注入。
- 调用海外大模型api导致敏感数据泄露。
- 恶意篡改训练数据导致模型逻辑偏差。
- 违规上传。
- 容器逃逸。
- 预训练模型风险。
- 传输至公有云大模型。
- 害内容。
- 模型幻觉生成看似合理但完全虚假的内容。
AIAgent大面积应用引入的安全风险:
- AIAgent(OpenClaw)爆发式演进,展现了极高的实用价值但暴露了“不安全”风险,如明文凭证存储与失控执行。
- Local-First自托管、多渠道交互、强执行能力的AI Agent引擎,社区热度高(Github Star 270K+)。
AIInfra安全体系的构建:
- 技术层:通过“安全左移”,在AI开发初期嵌入隐私与合规设计(Privacy by Design),例如研发专门的AI安全模型,检测和防御对抗样本攻击。
- 治理层:统一管理模型训练与部署风险,制定AI攻防演练标准,模拟红蓝对抗场景,通过实战演练提高防御方的应对能力。
- 合规层:遵循《生成式人工智能服务管理暂行办法》、《人工智能法案》等法规,建立适当的AI风险控制框架和审计标准,确保AI系统的合法合规运行。
- 伦理层:倡导“负责任AI”开发准则,平衡创新与安全,确保模型行为符合伦理道德准则。
AIInfra安全体系的应用实践:
- 大模型风险评估:围绕大模型的生命周期,根据不同阶段的风险制定对应的安全防护措施。
- RCE风险应对:包括滥用AI执行操作(如自动执行转账支付)和滥用AI读取内容(如读取账户密码)。
- 大模型运行环境保障:LLM-WAF为专为大语言模型设计的智能安全防护网关,提供全链路防护能力。
- AIAgent安全防护:构建宿主层、Runtime层及网络层的纵深防御体系,包括提示词注入攻击检测、Web攻击检测、OpenClaw提示词内容合规检测与拦截、网络层流量审计和溯源、Agent权限管理、tools Call检测和高危操作防护等。
最终,金融机构需要从战略高度重构安全体系,确保AI Infra的安全性,平衡创新与安全,确保AI技术的健康发展和合法合规运行。