大语言模型对抗性提示安全性基准测试
摘要
确保大语言模型(LLM)安全部署需要综合方法,而非仅靠扩大模型规模或增加训练数据。本研究介绍了一个针对安全相关提示词的新型评估数据集,并评估了多个主流开源和闭源模型在各类危害场景下的表现。研究结果表明,社会规范和训练实践等环境因素会在安全关键场景中影响模型行为。
引言
大语言模型(LLM)在生成类人文本方面展现出强大能力,但其易受对抗性提示影响,可能生成有害、有偏见或不安全的输出,带来严重安全问题。理解这些漏洞对于开发更稳健、更对齐的AI系统至关重要。
背景
LLM的安全性已引起广泛关注。早期工作包括构建不安全输出及失效模式的分类体系,以及使用RealToxicityPrompts等数据集衡量模型输出中的神经毒性退化。宪法式AI等微调方法通过人机协作训练AI模型,使其能够相互监控和评估无害性。对抗性提示技术已成为探测LLM漏洞的关键工具,研究表明对输入进行细微修改就能诱导模型产生不当行为。
研究方法
研究团队设计了包含1,000个对抗性提示词的评估数据集,使用模型开发者提供的官方API对DeepSeek R1、Claude 3.7 Sonnet、LLAMA 3.3 70B Instruct和GPT-4o四个主流LLM进行系统性评估。采用以内容审核为核心的模型进行单盲预筛选,人工评估员根据危害性标准对每个输出进行1-5分评分。评估框架包括基于技术的分析、基于身份的分析、特定模型的漏洞分析。
结果
评估揭示四个受测模型的安全性能存在显著差异。Claude 3.7 Sonnet表现最佳,无害响应占比超过80%;DeepSeek R1表现最差,无害响应占比仅为14.7%。卡方独立性检验显示,不同模型的无害响应与有害响应占比存在统计学上的显著差异(p值低至7.79e-226)。
讨论
规避技术
评估结果显示,多种对抗性提示技术在所有模型中均呈现较高的危害评分,暴露出安全防护机制中的关键漏洞。虚拟化技术(通过虚构情景构建规避)和规避技术(通过模糊表述或隐晦指代规避)能有效绕过安全过滤机制,并显著提升危害评分。直接过滤规避与提示词注入、说服与持续策略等攻击手段也增加了生成不安全内容的可能性。
安全性能评估
模型间安全指标的显著差异表明,模型开发、训练和部署的背景与技术对模型安全结果的影响要大于单纯的模型规模和计算资源。机构的安全理念与模型行为之间存在相关性,采用稳健安全协议和保守内容审核机制的模型更难被攻破。
基于身份的挑战
涉及敏感身份群体(宗教、生理性别、残障状况、性取向等)的提示词均产生了更高的危害评分,凸显了LLM在处理训练数据中隐含的复杂且往往带有偏见的相关时面临的挑战。
影响现实世界安全性的部署因素
系统提示词、内容审核层和持续监控协议等因素决定了模型面临对抗性压力时的表现。采用强有力的、以安全为导向的系统提示词,搭配多层安全策略和持续监控,可以显著提升模型的安全表现。
结论
通过有意识的努力可以实现LLM的安全性,需要采取涵盖开发、训练和部署全流程的综合方案。机构的优先级设定和实施决策在很大程度上决定了在现实世界中的安全结果。建议部署LLM的机构采用全面的安全训练、多层安全系统、针对身份相关内容制定专门的处理协议、建立持续监控系统、定期开展对抗性测试、组建包容性开发团队、维持强有力的系统提示词等最佳实践。
参考文献
(略)