亚太地区各组织中评估人工智能的自主性、责任性和可追溯性指南 目录 03050812192834424447Sumsub如何帮助50前言人工智能采用趋势方法论问责不对称性其他观察按部门分解按市场细分监管锚点概览接下来是什么人工智能治理准备清单 前言 过去几年里,我们大多数人问过关于人工智能的一个问题:它能为我们做什么?一个更严肃的问题取而代之:它在替我们做什么,我们又能否证明这一点? 人工智能已超越助理的角色。曾经用于起草备忘录或标记异常的系统,如今可以自行开立工单、调动资金、批准交易,并在整个业务流程中完成多步骤任务,仅需少量人工输入。这些就是人工智能代理:一种以软件形式存在、追求目标、在过程中做出选择、并能在实际系统中自主采取行动的实体。人工智能代理开始像企业内的参与者一样行事,并且越来越多地与该企业之外的世界进行交互。 这一变化重塑了人工智能治理需要达成的目标。当一个人做出决策时,责任归属是明确的。当人工智能代理每天做出数千个决策时,组织必须能够应要求回答三个问题:人工智能做了什么,为什么这样做,以及谁对结果负责? 本指南衡量了亚太地区各组织回答那三个问题的准备情况。 人工智能采用趋势 在亚太地区,人工智能已不再局限于大多数组织中的孤立试点项目。近四分之三的企业已将其应用于多个业务领域。它在数据分析、运营和客户服务等分析及操作工作中应用最为广泛,尽管具体应用场景因行业而异:超过一半的金融服务企业利用它进行合规审查和案例审核,近四分之三的企业则用它进行欺诈检测。 普遍采用已不再是重点;人工智能正日益自主运行,执行工作流程、发起调用,并完成多步骤任务,无需每一步都由人工介入。 根据调查,72%的组织表示,人工智能要么在获得批准的情况下处理决策和行动(51%),要么独立行动并接受基于例外情况的监督(21%),通常针对内部团队或客户,而较少针对外部商业利益相关者。随着你沿着曲线向下移动,人工监督会逐渐减少。 当前紧迫的问题在于如何治理为我们行动的AI,而这正是该基准通过三个支柱——自主性、责任性和可追溯性——进行评估的内容。 方法论 本研究由Blackbox Research独立进行,由Sumsub委托,并与新加坡金融科技协会合作开展。研究由来自加密货币和金融服务领域选定的参与者进行圆桌讨论,从而构建了研究框架并揭示了实地趋势。 随后,一项定量调查覆盖了九个亚太市场以及四个行业(技术、产品、风险、合规和运营)中的720名高级专业人员。该研究于2026年4月至6月期间持续了三个月。 该基准使用一套专门的调查问卷,从三个支柱层面为每个组织打分,分数范围从0到100。分数越高,代表治理水平越先进。 责任 人工智能在组织内部目前已能自主行动到何种程度 该组织对其人工智能的所做所为,拥有多么清晰的归属权并负有多么明确的责任。 该组织能否重建、解释和审计其人工智能所做之事 人工智能是否能在有限的 human 输入下执行多步骤任务 谁对人工智能驱动的结果负责 追踪和解释人工智能决策的信心 当人工智能出错时,谁应承担责任? 现有的支持可追溯性的能力 人工智能发挥的最先进作用 现有的治理控制措施 剩余的差距与障碍 代理人采取行动前所需的批准级别 若其未被关闭,需注意其风险 自主代理角色的广度 AI自主性的预期轨迹 受访者简介: 该研究还根据治理分数将组织划分为三个成熟度等级: 问责不对称性 可追溯性在所有领域和市场中都落后于自主性和责任感。亚太地区的组织在整体人工智能治理方面得分为67.1分,但这个主要数字掩盖了重要趋势。自主性和责任感都接近70分,而可追溯性则降至61.0分。 我们将这个差距称为“问责不对称”:即组织对其人工智能决策的承担程度与它们能够证明这些决策为何如此之好的距离。自主性会加剧这种不对称:一种你已接受但无法重建的责任,或者一旦监管机构、股东或客户要求你说明发生了什么,审计就成为一种你无法量化的负债。 亚太地区的各组织正积极承担由人工智能驱动的成果。它们所缺乏的是生成证据的能力。95%的受访者表示他们有信心能够解释人工智能的决策,然而只有50%能够重建决策路径,仅有38%拥有不可篡改的审计追踪。真正的挑战在于,当监管机构、股东或客户进一步调查时,这些决策能否站得住脚。 这个差距真正在于证据。 亚太地区已进入高度自主化阶段,系统执行决策的速度和规模已超出直接人工监督的范围。可追溯性未能跟上步伐。这带来了结构性风险:企业在不具备监控、审计或介入的基础设施的情况下扩大决策范围,从而扩大了在合规、运营和客户信任方面的风险敞口。 自主性正超越控制。 自主性是油门,责任感是驾驶员坚持掌控局面,可追溯性是方向盘。目前,亚太地区的许多企业正握着油门却没握着方向盘。许多人正在扩大人工智能的使用范围,许多人愿意为其决策负责,但许多人仍然无法追溯人工智能做了什么,也无法事后纠正。 一个有助于理解它的方法 自主性在此处起到了放大作用。当人工智能以手工团队无法追踪的规模和速度做出决策时,其行为与可重建之间的差距只会越来越大。这种差距越明显,最终的成本就越高,因为届时人工智能已经执行了数千个无人能够解释的行动。 任何AI未留下可追溯记录的行为,都是被推迟的成本,而非被避免。可解释性就是让你在账单到期前看到账单。 Sumsub高级工程经理迈克·阿梅利什科 “AI Agent”是一个涵盖性术语。如今,这个标签涵盖了广泛的范围。一个系统在该范围中的位置决定了在无人参与的情况下可以发生多少事情。下表概述了责任范围:一个系统在该表中的位置越靠右,其监督就越薄弱,责任不对等性就越大,因为行动的累积速度比任何人能够重新构建它们的速度都要快。 一系列自主权 占据主导地位的关注是实际层面的问题:决策是否值得信赖且可重建。不正确或不可靠的决策(52%)、数据质量或输入问题(43%),以及缺乏透明度或可解释性(33%)都属于可靠性与证据问题,而监管或合规风险(44%)与之并驾齐驱。欺诈或滥用——AI风险中最引人注目的版本——其排名较低,为31%。 仅有5%的机构表示没有重大担忧,信号几乎是一致的:95%的机构认为,当AI为他们行动时,确实存在风险,而他们所指的风险是运营风险和证据风险,即日常的输出能否经受住审视的问题。 其他观察 人工智能首先在风险最低的领域实现自主性。自主代理首先出现在运营、客户服务和内部分析领域。支付、合规和反洗钱(AML)则相对滞后,因为这些领域一旦出错代价最大。在采用新流程方面,人们更加谨慎。 受访者可以选择对此问题进行多选 一张路由错误的票证只需几分钟处理。欺诈检测、反洗钱 (AML) 和风险监控看起来是代理(模式分析、规则遵循、分诊、转交下一步)的天然用武之地,然而只有39%的人报告称在这些领域有自主代理角色,在合规和案例审查中这一比例仅为35%。纸面上看,这些接近理想的应用场景,但谨慎态度是完全可以理解的:代理式AI仍是一项新技术,需要谨慎采用和监管。 通往自主AI的道路很可能将是渐进式的,而非非此即彼式的。金融科技公司正首先将AI代理应用于低风险工作流程,同时保留人工监督,以处理涉及客户入职、客户资金划转及其他受监管活动等决策。在技术本身取得进展的同时,建立治理方面的信任也同样重要。 新加坡金融科技协会主席 范晓莉 有三个因素阻碍了它: 1 错误决策的代价是不对称且严重的。 第二项:未报明的受许可实体或未提交的可疑活动报告将导致罚款、执照风险以及被点名官员的个人责任。 3 假阳性会令合法客户经历摩擦,并可能引发公平对待的投诉。 仅有50%的人能够重建决策路径,且仅有38%的人拥有不可篡改的审计追踪记录。将最高风险的决定权交给代理人,意味着采取无法在要求时解释的行动。这种张力在监管领域尤为明显,例如反洗钱领域,其问责结构已十分明确。反洗钱的问责制基于个人:洗钱报告官员签字确认,而监管机构则期望有人来回答。 滞后性体现在可追溯性差距,并在风险最高的地方造成损害。只有当公司能够在监管机构要求时重建并说明其做出的每一通电话记录时,该代理人才能在反欺诈和反洗钱工作中被信任,这使得审计追踪成为关键要求。金融服务行业比其他任何行业都更具优势,有68%的公司保留着人工智能决策的审计追踪记录,这是最高的比例。即便如此,更难的能力也很罕见:只有41%的公司持有安全且防篡改的记录,与IT水平持平且领先于其他行业,但这远未达到当代理人大规模进行此类通话时监管机构所要求的防御水平。 真正的挑战并非AI能否做决策,而是其决策是否值得信赖。这项研究表明,在支付和金融交易方面,组织比在其他业务职能上更为谨慎,这反映了涉及金钱时更高的问责标准。研究结果表明,透明度、安全性和问责制在AI驱动的商业中至关重要。 尼米特·古拉蒂Visa亚太区副总裁,接受解决方案及增值服务部 只有31%的人表示AI能在有限的人类输入下启动或完成多步骤任务,这是曲线的自主端。对于大多数组织而言,基于规则的执行(28%)或常规自动化(27%)仍然是上限。 真正的代理式人工智能仍处于起步阶段。 大多数企业仍面临人工智能部署瓶颈,无法完全实现人工智能承诺的成本节约。其背后的鸿沟具有基础性:真正的自主AI需要非结构化数据访问、跨平台API以及灵活的软件集成。陷入常规自动化陷阱的组织,往往受制于遗留技术债务、数据孤岛和僵化架构。处于自主端31%的企业通常拥有更干净的数据管道和更强的数字基础设施,因此他们与他人的差距是一个需要数年和真金白银才能弥补的基础设施鸿沟。 超过九成的受访者承认,在过去一年中他们曾将人工智能系统用于超出其最初设计的目的。大约六成的受访者表示,他们已经遇到过自主人工智能操作出现失误的情况。 人工智能的使用正超出其控制范围。 图8:经历了一次自主AI行动,但产生了非预期或存在问题的结果 过去一年中,92%的人扩大了系统的范围,其中30%显著扩大了范围,因为如今运行的AI很少是当初被审查和批准的AI。63%的人已经目睹了自主行动产生了非预期或存在问题的结果,其中31%不止见过一次。 其范围扩张的速度快于其周边的管控,这正是实时上演的问责不对称:越自主,越偏离,以及越来越多的行动堆砌,而这些行动最终所做的事情,却从未有过相应的管控。 按部门分解 金融服务(40%)和IT与软件服务(39%)运行真正具有自主性的AI的可能性,几乎是电子商务和市场(21%)或出行与配送平台(23%)的两倍,在这些领域,AI会发起或完成需要有限人工输入的多步骤任务。 图9:按部门分解 大型语言模型的一个关键价值在于其知识制度化能力。例如,银行可能处理数百份贷项通知单,但任何个人通常只接触到其中一小部分。通过捕捉这种集体专业知识,新员工可以从银行积累的最佳实践中起步,而不是从零开始。人工智能可以创建初稿或建议,但人类仍然需要对审查、验证和最终决策负责。 花永浩,CIMB新加坡数字数据与人工智能采用主管 金融服务 最成熟的领域,也是审计追踪最具分量的地方。金融机构行动迅速,72%的企业在生产中运行多步AI系统,并在整体治理得分上位居最高,达到69.6,同时在责任和可追溯性方面均领先。 严格的监管标准几乎没有选择余地:当AI代表公司行事时,人们认为的最大风险是监管或合规风险(54%)以及欺诈或滥用(34%)。如果自动化系统触发意外付款,不可更改的审计追踪的缺失会直接导致责任。68%的公司保留AI决策的审计追踪,领先于IT(59%)、电子商务(50%)和移动出行(55%)。 最具侵略性的行业。94%的企业自主执行多步流程,42%的企业在过去一年中将AI系统显著扩展至其原始范围之外,这是所有行业中最高的。该行业还拥有最多的领先组织,占比达31%。这种高速环境滋生了代理漂移现象,即软件工作流程半独立运行,导致企业面临数据质量问题(50%)和缺乏明确的监管指导(46%)。 信息技术与软件服务 中等成熟度,平均治理得分为65.4。该领域更倚重实用、运营层面的管控