核心观点: 该研报分析了人工智能(AI)造成伤害的多种机制,并强调了当前预防措施存在的不足。报告认为,单一的预防方法无法有效应对AI风险,需要根据不同的伤害机制采取多样化的社会技术方法。
关键数据: 研报基于人工智能事件数据库(AIID)中的200多个真实案例,识别出六种主要的AI伤害机制,包括有意伤害(设计缺陷、AI滥用、针对AI系统的攻击)和无意伤害(AI故障、人类监督失败、集成伤害)。
研究结论:
- 多样化预防策略: 由于AI伤害的途径多样,需要采用多样化的预防策略。单纯的技术解决方案无法解决所有问题,需要从测试和评估协议到参与式AI采用过程,采取广泛的社会技术措施。
- 模型能力并非关键因素: AI伤害的风险与模型能力并非完全相关。即使是功能单一的AI系统也可能造成伤害。因此,需要关注AI设计、测试和部署的背景、方式和治理,而不是仅仅关注模型的能力。
- 综合事件跟踪的重要性: 全面的事件跟踪对于了解AI风险和制定有效的缓解策略至关重要。随着AI技术的不断发展,新的风险和伤害形式将不断出现。因此,需要建立有效的学习机制,以快速适应和应对这些新挑战。
六种AI伤害机制:
- 有意伤害:
- 设计缺陷: 指AI系统被设计用于造成伤害的目的,例如用于军事或执法领域的AI系统,以及深度伪造应用程序。
- AI滥用: 指用户将AI系统用于开发者意图之外的目的,例如使用AI生成恶意软件或进行网络钓鱼攻击。
- 针对AI系统的攻击: 指网络攻击者通过攻击AI系统来绕过安全防护措施,例如通过提示注入攻击来生成有害内容。
- 无意伤害:
- AI故障: 指AI系统出现错误、故障、性能下降或产生有偏见的输出,例如COMPAS风险评估算法中的种族偏见。
- 人类监督失败: 指人类监督者未能检测到AI系统的异常行为、偏见或性能问题,例如英国政府基于有缺陷的语音识别系统取消了大量移民签证。
- 集成伤害: 指AI系统在不适当的环境中部署造成的伤害,即使AI系统本身功能正常,也可能产生意想不到的后果,例如搜索引擎算法加剧了疫苗虚假信息的传播。