核心观点
本指南旨在为政府测试团队提供有关人工智能(AI)系统和人工智能赋能系统(AIES)的开发测试与评估(DT&E)的指导。指南强调AI技术带来的独特挑战,并提供相应的解决方案,以支持政府测试团队规划和执行AIES的DT&E,并向决策者和利益相关者提供关键见解。
AI带来的挑战
- 模型输出的内在不可预测性:AI模型在实际应用中的输出结果难以预测,这给传统测试方法带来了挑战。
- 模型对输入的敏感性:AI模型对输入的微小变化非常敏感,可能导致输出结果发生巨大变化。
- AI模型的复杂性和不透明性:某些AI模型的结构复杂且难以理解,这使得诊断和表征其能力和局限性变得困难。
- 参数空间的维度高:AI模型的参数空间通常非常高维,这使得全面测试变得不可行。
- 对训练数据的高度依赖:AI模型的表现高度依赖于训练数据,因此确保训练数据的质量和代表性至关重要。
指南强调的解决方案
- 早期参与开发:将测试团队尽早纳入AIES开发过程,以确保系统与作战目标的一致性。
- 使用形式化方法进行增强:形式化方法为传统物理测试提供了补充,允许更精确地验证AI系统。
- 确保可测试的需求:确保系统需求是可测试的,并开发可行的测试计划来支持必要的评估。
- 为系统和使用概念(CONEMP)开发提供信息:迭代开发AIES及其与CONEMP的紧密耦合需要DT&E测量活动来为系统和CONEMP开发人员提供信息。
指南涵盖的关键领域
- AI赋能系统概述:介绍了AI系统的最新进展及其对DT&E职责的影响,包括性能评估、风险评估和对系统工程的支持。
- AI驱动的测试实践变化:介绍了与ML相关的特定测试方法,例如数据准备、模型训练、模型评估和形式化方法。
- 测试社区扩大互动:讨论了测试社区与合同、需求开发、CONEMP开发、设计权衡和认证与认证支持等方面的扩大互动。
研究结论
- AI技术的使用对DT&E提出了新的挑战,需要采用新的方法和工具来应对。
- 测试团队需要尽早参与AIES开发过程,以确保系统与作战目标的一致性。
- 形式化方法和建模与仿真可以补充传统测试方法,并帮助提高AI系统的可靠性。
- 测试社区需要与其他社区进行扩大互动,以优化AIES的开发和部署。