核心观点与关键术语解释
灾难性风险(Catastrophic Risk)
灾难性风险指破坏力极强、远超常规应对能力的极端事件,其特征为破坏烈度极高、影响范围广泛、持续时间漫长。在人工智能领域,此类风险可能体现为系统因复杂架构产生不可预测的突发行为,或技术遭恶意滥用导致大规模危害。形成机制通常源于技术迭代速度超越人类监管能力,或现有治理体系无法有效约束技术发展。
生存风险(Existential Risk)
生存风险是风险谱系中最严峻的类别,直接威胁人类物种存续,可能彻底阻断文明发展轨迹。这类风险具有不可逆特性,能够彻底消弭文明复苏的可能。在人工智能领域,此类风险可能出现的情景包括:系统具备超越人类认知边界的智能水平、文明演进方向出现根本性偏移、人类在关键领域丧失控制权、自主系统脱离监管破坏战略稳定,或有效治理框架之外运行的自主能力所导致的战略不稳定。
人工智能可控性(AI Controllability)
人工智能可控性指人工智能系统在设定的条件(场景)和规定时间内,通过一系列策略、机制和技术保障,持续、稳定、可靠且安全地完成预定义的任务/功能的能力。在发生故障时,系统应能即时隔离故障模块、维持安全状态、并具有可恢复性。鉴于前沿人工智能系统的“黑箱”技术特征和人类价值观的多元,实现对前沿人工智能系统实施完全控制面临较大挑战,需要更全面的风险缓解策略和敏捷治理方法。
人工智能可治理性(AI Governability)
人工智能可治理性指通过制度、法律、技术、市场等机制,提高AI系统的可解释性、透明性、公平性、可靠性、安全性,以及AI事故的可追溯性和可问责性,切实维护国家主权、安全和发展利益,保障公民、法人和其他组织的合法权益,确保人工智能技术造福于人类。
故意升级(Intentional Escalation)
故意升级指某一行为体为实现战略目标或影响对手行为而有计划、有目的地提高冲突的强度或范围。这种升级行为可能包括公开的军事行动、激进的言辞或有控制地使用武力等,以表明决心或争取让步。战略信号传递和风险管理是这类升级内涵的重要组成部分。
非故意升级(Unintentional Escalation)
非故意升级指在危机当中由行动之非预期后果所引发的冲突强度上升。这种升级并非出于刻意的意图,而是由于沟通失误、误解或程序性错误等因素无意中加剧了紧张局势。这类升级凸显了有效沟通和程序管理的重要性。
失控危机(Out of Control Crisis)
失控危机指人工智能系统因为技术原因作出与预设目标不相符的举动,且人类操作员无法对其进行有效控制,或无法在其酿成灾难性后果前终止系统。原因可能在于人工智能系统链式反应的技术性故障,也可能在于人工智能系统出现“自主意识”。
战略稳定(Strategic Stability)
狭义的战略稳定特指核武器领域,包括相互确保摧毁、危机稳定和军备竞赛稳定等内涵。广义的战略稳定是指在全球范围内,各行为主体通过保持自我克制并进行相互制约,从而在国际体系层面形成的一种相对稳定、平衡的战略态势。
两用技术(Dual-use Technology)
两用技术指既有民事用途,又有军事用途或有助于提升军事潜力,特别是可以用于设计、开发、生产或者使用大规模杀伤性武器及其运载工具的技术,包括相关的技术资料等数据。
研究结论
该研报通过术语解释和情景分析,探讨了人工智能潜在的安全风险,强调了可控性、可治理性在风险管理中的重要性,并指出了故意升级、非故意升级、失控危机等风险场景的潜在影响。同时,研报还提及了战略稳定和两用技术在人工智能风险背景下的特殊意义,为后续的风险治理和政策制定提供了参考框架。