AGI 风险缓解策略
Google DeepMind 的 AGI 风险缓解策略报告提出了一个全面的方法来应对 AGI 带来的潜在严重风险,重点关注技术安全和安保缓解措施。该策略主要针对滥用和错位两种风险领域。
滥用风险方面,策略的核心是阻止恶意行为者访问危险功能。这通过模型级别的安全部署缓解措施(如安全后训练和功能抑制)和系统级别的安全部署缓解措施(如监控、访问限制和模型权重安全)来实现。此外,还提出了社会准备缓解措施,利用 AI 系统来强化社会防御,例如快速修复关键基础设施的漏洞。
错位风险方面,策略采用双重防御方法。首先,通过模型级别的缓解措施(如放大监督和鲁棒训练)来确保模型不会追求错位目标。其次,通过系统级别的缓解措施(如监控、访问控制和计算机安全技术)来防御即使模型错位也能造成的损害。
报告还强调了在训练一个对齐的模型方面进行投资的重要性,并讨论了更安全的 设计模式和可解释性等技术领域,以加强风险缓解能力。
总体而言,该策略旨在通过结合技术缓解措施和有效的治理措施,确保 AGI 的安全和可靠。报告认为,虽然存在许多开放的研究问题,但该策略为 AGI 安全领域提供了一个有价值的路线图,并希望社区能够共同努力,确保 AGI 的巨大潜力能够造福人类。