人工智能词典:资源与风险
关键要点
- 人工智能与其他技术交织,其更大规模采用将推动邻近领域创新并降低成本,同时成为地缘政治、经济和企业的关键要素。
- 人工智能存在风险,如幻觉和深度伪造,可能侵蚀公众对信息来源的信任。
深度伪造
- 定义:人工智能生成的模仿真实人物或场景的内容(视频、声音等),可以是原创或修改现有内容。
- 风险:技术进步使深度伪造更难检测,并被用于恶意目的(如传播虚假信息、网络犯罪)。
- 检测方式:区块链可通过密码学签名和不可变性特性提供审计追踪,保证内容完整性。
幻觉
- 定义:模型生成的看似合理但实际错误、不相关或无意义的输出。
- 原因:训练数据质量、不完整或模型难以理解现实世界知识导致。
- 影响:可能导致错误预测、误报、漏报,并引发错误信息和虚假信息问题。
- 缓解措施:高质量训练数据、可信来源和具体提示可减少幻觉。
推理
- 定义:训练好的机器学习模型根据新数据得出结论的能力。
- 阶段:训练阶段发现数据模式,推理阶段应用模式进行预测、生成内容或决策。
- 特点:推理更注重延迟,成本持续下降,模型使用阶段增加计算量。
知识图谱
- 定义:整合多来源数据,捕获主题信息并建立联系,使用机器学习和自然语言处理构建。
- 特征:图状组织、语义编码、存活性。
- 用途:搜索引擎、聊天机器人、推荐引擎、客户关系管理等。
- 作用:缓解幻觉问题,与大型语言模型集成提供准确知识库,增强推理和可解释性。
负责任的AI
- 定义:指导AI系统开发和部署的原则。
- 原则:公平性、隐私和安全、可解释性、透明度、治理、可靠性与安全性、包容性、问责制。
- 法规:全球多国制定AI法律,如奥地利、比利时、拉脱维亚、美国加州和科罗拉多州。
- 欧盟人工智能法案:对AI系统按风险分类(不可接受、高风险、有限风险、低风险),并规定相应监管措施。
检索增强生成
- 定义:利用外部数据源信息提升生成式AI模型准确性和可靠性的技术。
- 运作:检索外部数据并预处理,整合到预训练模型中。
- 优势:获取最新信息、提供事实基础、提高生产力、减少幻觉、降低成本。
- 应用:聊天机器人、客户获取等生成式AI应用。
半导体
- 定义:电子设备的核心组件,处理、存储和传输数据。
- 关键类型:中央处理器(CPU)、图形处理器(GPU)、专用集成电路(ASIC)、现场可编程门阵列(FPGA)。
- 需求:人工智能加速对更强大芯片的需求,市场机会超过1万亿美元。
主权的AI
- 定义:国家利用自身资源生产人工智能的能力。
- 意义:涉及16万亿美元年经济价值,关乎技术、资源、供应链、监管和标准的竞争。
- 案例:新加坡、印度投入巨资发展主权人工智能。
- 影响因素:计算能力、能源、数据、人才等资源获取。
合成数据
- 定义:模拟真实世界数据的人造数据,通过统计方法或生成式AI创建。
- 用途:训练机器学习模型,特别是在数据有限或获取困难的情况下。
- 应用:自动驾驶汽车、人形机器人、制药行业。
训练
- 定义:教人工智能模型识别模式并根据数据做出预测的过程。
- 方法:反向传播错误并调整神经元权重。
- 特点:吞吐量重要,需要大量计算能力(GPU)。
- 趋势:模型尺寸和训练数据集快速增长,计算需求和能源消耗增加。