当前人工智能技术发展迅速,但也面临着数据投毒、算法偏见、模型脆弱性等安全挑战,需要构建一套能够抵御内外部威胁、确保AI健康可持续发展的安全体系。本蓝皮书提出内生安全赋能人工智能应用系统构建的方法,利用内生安全机理中内在的构造效应,从体制机理上管控或规避人工智能应用系统面临的破坏及威胁。
人工智能应用系统面临的安全风险主要包括数据安全风险、算法安全风险、模型安全风险、软硬件运行环境安全风险、恶意使用风险、法律和伦理风险以及系统同质化和系统性风险。这些风险的成因包括人工智能算法理论存在局限性、人工智能算法结果难以解释、人工智能应用系统要素缺乏安全性以及法律、伦理和信任度等社会因素共同作用。
人工智能应用系统的内生安全问题包括共性问题,如软件的安全漏洞数量持续增加、硬件产品的安全漏洞日益严峻;以及个性问题,如DNN的“黑盒”特点导致的可解释性差、DNN对样本的过度依赖导致的适应性弱、DNN的知识提炼模式导致的不可推论性。此外,人工智能应用系统还面临着广义功能安全问题,如新域新质的广义功能安全风险凸显、人工智能应用系统容易引发安全事故、智能体一旦失控将危及人类安全。
为解决人工智能应用系统安全问题,本蓝皮书提出内生安全赋能人工智能应用系统构建的方法,即利用动态异构冗余(DHR)架构,通过数据集异构、模型结构异构、训练方法异构和推理方法异构等方式构建差异化AI模型,并通过结果融合裁决输出,实现内生安全。然而,工程化构建实现具备内生安全机理的人工智能应用系统仍然面临着提高AI模型算法鲁棒性、构建AI模型安全监测体系、提升AI价值观对齐能力以及建强AI应用系统安全环境等难题。
最后,本蓝皮书提出六点政策建议,包括加快推进人工智能应用系统立法保护、加快人工智能应用系统供给侧安全治理、加快建立国家级人工智能安全试验场、加快转变教育范式培养负责任的开发者、不断提高人工智能内生安全治理的国际影响力以及建立健全人工智能应用系统风险等级划分制度。