有意义的成果决定了健康人工智能竞赛的赢家 白皮书 2026年6月 内容 1执行摘要4引言 5前言 3所述与所测 2 人工智能对卫生系统的影响证据 8 2.1 自动化与效率 82.2 评估AI成果 9 13 4 展望未来 17 分析完成后,使用生成式人工智能工具来支持草拟的某些方面。所有输出均由作者独立进行审阅、核实和批准。 免责声明 本文件由世界经济论坛发布,作为对某项目、洞察领域或互动的贡献。此处表达的研究发现、解读和结论是经世界经济论坛促进和认可的合作过程的结果,但其结果不一定代表世界经济论坛、其全体成员、合作伙伴或其他利益相关者的观点。 © 2026 世界经济论坛。版权所有。本出版物之任何部分均不得以任何形式或任何方式复制或传播,包括影印和录音,或通过任何信息存储和检索系统。 前言 伊莱亚斯·莫西亚洛斯伦敦政治经济学院全球健康郑裕彤讲座教授;伦敦政治经济学院卫生研究所所长 shyam bishen健康与医疗中心主席;世界经济论坛执行委员会成员 人工智能已不再是医疗系统的未来愿景。它已经到来,正在大规模部署,并重塑着医疗服务的提供、管理和融资方式。投资规模巨大,承诺也极为大胆。但所有其他问题之前,那个最应被首先问及的问题仍然没有得到充分回应:医疗系统是否正在用这些技术为正确的人群追求正确的成果? 工作流。这项分析处于数字健康转型和基于结果的护理的交汇点。这两个学科都依赖于理解和量化“价值”。但如果没有共同的语言或框架评估,我们如何决定什么是价值以及如何追求它? 那个问题的紧迫性并非空泛。医疗系统正快速做出具有重大影响的AI应用决策,从基于未经证实的生产力提升的工作force策略,到无需医生参与的自主处方,并且在大多数情况下,缺乏对预期产出结果的共同理解。本文呼吁暂停的是假设,而非技术本身。我们将其推荐给医疗系统领导者、政策制定者、技术开发者以及所有致力于确保医疗AI竞赛的胜利不在于最快而在于最明智,并能为我们的医疗系统和所服务的民众提供最佳价值的人们。 本白皮书认为,情况并非如此——至少目前还不是——并探讨了原因。它提出了价值反转的概念:即卫生系统中做出人工智能应用决策者与其承担后果者之间的结构性错位,并提出了一个基于利益相关者定义的、有意义的成果的、切实可行的解决方案。该白皮书的建议具有实践性,其分析基于证据和专家咨询,其目标具有全球性。本白皮书也反映了健康与医疗保健中心两个核心领域的有意趋同。 执行摘要 医疗保健领域的AI应以实现有意义的成果为中心,而非展示最新技术。 人工智能(AI)正以前所未有的速度重塑医疗保健。2025年,全球对医疗保健AI的投资已超过180亿美元,大型医疗系统也正对该技术做出重大承诺,但缺乏对这笔投资应实现何种成果、针对哪些利益相关群体以及依据何种基准的共同理解。本白皮书认为,挑战并非医疗系统缺乏定义价值的智力工具,而是AI的采用速度超过了这些工具的应用速度。换句话说,在医疗AI领域,赢家将不是拥有最先进技术的系统,而是首先识别并追求对病人、专业人士和医疗系统都至关重要的成果,并构建治理架构来交付这些成果的系统。 基于案头研究、对卫生系统领导者、技术开发者和政策制定者的专家访谈,以及世界经济论坛成果导向护理和数字医疗转型计划、以及伦敦政治经济学院健康学院的AI与数字部门所拥有的综合专业知识,本文提出了围绕有意义成果重新调整AI治理的四大原则: 应自下而上地识别有意义的成果,通过与患者和一线专业人员的结构化参与相结合,并自上而下地通过采购和问责制框架来追求这些成果。 2.公私合作应转向共同创建具有临床意义、商业可行性和治理准备性的成果定义。 该论文指出了当前医疗体系评估人工智能的核心处存在结构性错位。那些已被最有力证明的成果——通常是效率提升(节省文档时间、增加就诊次数、更准确地捕捉账单编码)——与该技术本身最为接近。这些收益是否转化为更好的患者结果、减少不平等或可持续的护理提供,在很大程度上仍未得到衡量。该论文指出了其所谓的医疗体系当前采用人工智能的核心处的价值倒置:系统并非衡量对患者和专业人士而言重要的事项,而是衡量对控制采购的治理层而言最方便的事项。人工智能价值的定义是由那些最远离其后果的人设定的,随着决策权力的提升,证据标准会降低,而决定人工智能是否“有效”的指标则反映了测量者的优先事项而非被测量者。 3.技术的精深重要,但追求正确的结果更为关键。 第4条:结果框架必须具有情境适应性,既适用于资源匮乏的环境,也适用于资源丰富的环境。评估应反映实际应用场景、风险等级、部署环境和反事实情况,包括替代方案可能延迟、受限或无法获得护理的情境。这并不意味着降低安全标准;这意味着要确保证据要求、安全保护措施、升级路径和监测工作是针对具体情境进行调整,而不是照搬照抄资源充足的设置。 为医疗保健系统中的AI明确定义、衡量和追求有意义的成果,并非一项技术性工作。它是一项治理挑战,需要全球范围内的多方协作。 引言 人工智能在医疗保健领域的表现,是依据系统效率来评估的,而不是依据更难衡量的对患者和专业人士的好处。 关乎患者、专业人士和卫生系统的价值,并构建治理架构以实现这些价值。本文指出了当前卫生系统采用人工智能时存在的价值倒置问题。不同治理层级自然从不同视角看待价值:一线团队关注安全、工作流程和患者体验;高管和采购团队也必须权衡可负担性、可扩展性和系统性能。挑战在于这些视角尚未整合。由于最容易测量和报告,运营指标占据主导地位,而更难捕捉的成果(如信任、公平、劳动力可持续性和长期患者利益)则系统性地被低估。问题不在于运营指标本身错误;而在于除非与更广泛的成果联系起来,否则它们就是不完整的。其结果是,人工智能的价值定义在很大程度上被那些最远离其后果的人所塑造。 部署人工智能到医疗系统的竞赛正在加速。到2025年,全球医疗保健人工智能投资已超过180亿美元,占所有医疗保健风险投资总额的近一半。1 医疗系统、科技公司政府和政府正做出重大承诺,其动力在于预期人工智能将降低成本、提高质量并扩大已过度紧张的卫生工作队伍的覆盖范围。 这并非新现象。电子健康记录带来了无缝效率的承诺;整合照护模式承诺通过协调减少碎片化并降低成本。在每种情况下,技术都比指导其发展的治理结构发展得更快。人工智能是这种模式的最新且最强大的迭代。2022年,生成式人工智能进入公共领域,加速了一列长达70年一直在积蓄动力的创新列车。这列列车不能也不应该被阻止,但它需要被引导。问题不是医疗系统是否应该上车——大多数系统已经上了。问题在于这列火车是否在正确的轨道上。在医疗领域,最成功的AI策略将是那些将效率、财务可持续性和竞争定位与对患者、专业人士和人群的更好结果联系起来的策略。当这些价值形式保持一致时,AI投资会得到放大。当它们不一致时,结果就是衡量那些便利而非重要的事物。 本文的见解基于案头研究、专家访谈,并借鉴了论坛“基于结果的护理”和“数字医疗转型”倡议以及伦敦政治经济学院健康学院的AI与数字部门的综合专业知识。它提出了一条前进之路:通过识别现有框架所忽视的内容以及如何改进这些框架,自下而上地确定有意义的成果,并自上而下地追求这些成果,从而捕捉人工智能技术在卫生系统中的价值和效用。 本白皮书认为,在健康领域赢得人工智能竞赛的并非技术最先进者。获胜者将是那些最先识别并追求人工智能成果的系统。 1 被告知的内容与被测量的内容 人工智能在医疗保健领域的引入可能无法实现预期价值——尤其是在对应该衡量何种结果存在不确定性时。 人工智能在医疗保健领域的应用通常建立在两大支柱之上:降低成本和提高护理质量。在成本方面,人工智能驱动的行政任务自动化已经产生了可衡量的回报。仅环境临床文档生成就为2025年带来了6亿美元的收入,这得益于其减少医疗专业人员的职业倦怠和夺回临床时间的承诺。在质量方面,其雄心更大。精准医疗、通过影像学和基因组学进行早期诊断以及实时临床决策支持都显著体现在人工智能在医疗领域的投资逻辑中。在受控条件下,人工智能系统在特定任务类别中的诊断准确性与临床医生相当甚至更高,并具有潜在的流程效益。然而,在系统层面,这些收益的现实证据仍然有限。 即使临床医生接受了关于人工智能素养的正式培训,自动化偏见依然存在:发表在《新英格兰医学杂志》旗下专注于人工智能的专业期刊《NEJM AI》上的一项随机临床试验表明,完成了20小时人工智能素养项目的医疗专业人员仍然容易过度依赖人工智能生成的输出。7 如果人工智能的常规使用削弱了临床独立能力,那么这项技术或许正在创造一种依赖形式,而这种依赖会破坏其本应带来的质量改进。 风险已超出个体医疗专业人员的范畴。让医疗专业人员有效运用人工智能进行培训已被视为必要,关于核心能力的共识正开始形成。然而,将人工智能培训融入医学课程的结构性整合仍不统一。提升现有医疗工作者技能所需的资源并非每个医疗中心或每个专业类别都具备。这些风险加剧了资源充足与资源匮乏的医疗机构之间的差距,当人工智能技术被不当使用或不当规避时,还会对医疗质量产生下游影响。在低收入和中等收入国家,这种差距尤为突出,因为这些国家的基础医学教育基础设施本就压力重重。 这些投资并非没有风险。越来越多的证据表明,将人工智能整合到临床工作流程中可能会带来未被充分理解且在某些情况下可能具有主动危害的意外后果。发表在《柳叶刀·胃肠病学与肝脏病学》上的一项多中心观察性研究发现,常规接触人工智能辅助结肠镜检查的内窥镜医师,其未使用人工智能辅助的腺瘤检出率显著下降,这为人工智能辅助医疗实践中的技能退化提供了首个真实世界的临床证据。 2026年《自然·医学》杂志的一篇社论进一步论证,关于人工智能改善医疗的说法必须得到适当证据的支持。12 本文认为,这一悖论主要不是技术问题,而是结果问题:数十亿美元正被投入到人工智能技术的发展中,13 但由于缺乏对投资应达成的结果、受影响的相关方群体以及应使用的基准的共同理解,因此存在这一悖论。建立这种理解的基础是存在的。近期基于共识的研究工作已经识别出影响健康技术价值创造的关键因素,涵盖了学术界、产业界、患者代表、政策制定和医疗监管等各方,证明价值决定因素远不止直接临床结果,还包括更广泛的系统影响和相关方视角。14 挑战不在于医疗系统缺乏定义价值的智力工具,而在于人工智能的采用速度超过了这些工具的应用速度。 这些个体风险之下,存在着结构性问题。卫生系统正经历着经济学家长期以来所认识到的生产力悖论:即可见的技术投资与可衡量的生产力增长之间的差距。这一术语源于罗伯特·索洛在1987年的观察,他指出计算机时代无处不在,却未体现在生产力统计数据中,9它描述了IT投资未能转化为整体增长的现象。 近四十年后,这一模式正在重演。尽管企业普遍对人工智能充满热情,但高层领导的积极评估并未反映在更广泛的生产力数据中。人工智能在医疗保健领域的相关性并非理论空谈。2026年《柳叶刀》杂志上的一篇文章探讨了这样一种可能性:英国国家医疗服务体系(NHS)的十年健康计划可能基于对人工智能驱动生产力增长的乐观假设来进行人员规划,而这些假设尚未得到证实。文章指出,电子健康记录(EHR)表明,承诺的效率提升往往表现为文书工作负担的增加,而非工作量的减少。 2医疗系统中人工智能影响的证据 在评估人工智能在医疗保健领域的应用时,除了效率之外,还应考虑背景和影响。 人工智能在医疗系统中的证据基础正在迅速增长,但分布不均。少数医疗专科的AI应用案例已积累了大量关于效率提升的证据,而 对病人结果、群体健康和公平性的影响证据仍然不足。这种不对称性并非偶然;它反映了该领域选择测量的内容。 2.1 自动化与效率 最强的证据集中在行政自动化和工作流程效率方面。从患者与专业人士的对话中生成临床文档的“环境式AI书记员”已成为医疗保健领域最广泛部署的AI应用。近期发表在《美国医学会杂志》(JAMA)上的一项研究,覆盖了美国五个学术医疗系统,发现采用“环境式AI书记员”与文档时间显著减少以及每周就诊医生数