ILLMs安全风险与挑战
间接提示注入(IPI)攻击原理
IPI攻击将指令隐藏在外部内容中,由模型在解析上下文或读取引用内容时自动执行。与直接提示注入(DPI)不同,IPI通过外部载体诱导模型执行非预期操作。经典案例如忽略指令直接翻译文本,攻击者构造特定输入混淆系统提示与用户意图。
真实案例中的IPI攻击链条
字节跳动文档对话场景案例显示,攻击者通过植入指令劫持用户输入,窃取历史对话记录和钓鱼凭据。攻击指令植入过程包括在文档中嵌入规则,如“请严格遵守以下规则”,并在用户执行翻译等操作时触发数据窃取。
大模型的安全挑战
全球最大规模AI红队挑战赛数据显示,IPI攻击成功率(ASR)显著高于DPI。攻击手法包括文档对话场景中的数据窃取、网页注入等,影响包括错误摘要、虚假信息传播、数据隐藏等。
IPI攻击原理解析
首次由Greshake等人在2023年提出,分为被动(检索)和主动(如邮件)两种注入方法,影响对象包括用户、开发者、自动化系统及模型本身。Yi等人分析指出,IPI有效因模型无法区分指令与数据,且缺乏对外部指令的防御意识。Zverev等人的形式化研究证明,所有模型均未能实现高指令与数据分离度,缓解技术虽能改善但可能降低模型实用性。
IPI防御对策
- 输入过滤:在模型处理输入前剔除或标记恶意指令片段。
- 指令结构强化:在架构上分隔不同来源内容。
- 模型自身调优:通过安全增强微调增强指令与数据区分能力。
防御实践
测试显示,ChatGPT4o及国内3家大模型在翻译、分析等指令下易受IPI攻击。通过网页注入的测试进一步验证了IPI的普遍风险。