刘祥瑞1,∗,张媛媛2,∗,卢瀛洲(3),尹昌昌4,胡晓玲刘晓鸥5,6,1,陈璐璐(7),王胜8、Alexander Rodriguez9, Huaxiu Yao10, YezhouYang1, Ping Zhang4, Jintai Chen11, Tianfan Fu12, and Xiao Wang7 1美国亚利桑那州亚利桑那州立坦佩大学2美国印第安纳州西拉法叶普渡大学3美国加利福尼亚州斯坦福大学4俄亥俄州立大学,美国俄亥俄州哥伦布市5美国马萨诸塞州麻省波士顿市总医院6美国马萨诸塞州波士顿哈佛7弗吉尼亚理工学院,美国弗吉尼亚州布莱克斯伯格8华盛顿大学,美国华盛顿州西雅图市9密歇根,大学美国密歇根州安阿伯市10北卡罗来纳大学教堂山分校,美国北卡罗来纳州教堂山市11香港科技大学广州分校,中国广东省广州市12南京大学,中国江苏南京∗共同第一作者 摘要 基础模型于2021年首次提出,是大规模预训练模型(如大型语言模型(LLM)和视觉语言模型(VLM)),通过从大量无标记数据集中学习,无监督方法使其能够在各种下游任务中。表现出色这些模型(如GPT)可适用于问题解答和视觉理解等各种应用,性能优于特定任务的人工智能模型,因其在各领域。的广泛适用性而声名鹊起生物医学基础模型的开发标志着利用人工智能(AI)理解复杂生物现象、推进医学研究和实践的。一个重要里程碑本调查探讨了基础模型在生物医学领域不同领域的潜力,包括计算生物学、药物发现与开发、临床信息学、医学成像和公共卫生。这项调查的目的是激励人们不断研究基础模型在健康的应用科学中。arXiv:2503.02104v1 [cs.LG] 2025 1导言 基础模型"一词最早出现于2021年[1]。它一般是指在大规模数据集上预先训练好模型(LLM)和视觉语言模型(VLM),这些模型通常通过进行训练,的大型语言无监督的方法使具备其处理各种下游任务的。能力通过从无标记数据中,"基础模型"开发出了将输入映射到潜在嵌入的强大能力学习空间。因此,它们可以无缝地适应各种任务,性能优于特定任务的始终人工智能模型[2, 3]。,GPT[4]在上海量语言和视觉数据进行了取得了 预训练,并在中问题解答、信息检索、数据挖掘等众多任务出色的表现。 视觉理解。鉴于其变革潜力和,在相关的领域广泛适用性这些模型通常被称为"基础模型"。 基础模型的出现和发展可归因于几个关键因素。1)大量未标注数据:大量数据可用,但由于标记成本过高,监督训练并不可行[1]。2)人工智能模型规模扩大:人工智能模型的架构已发展得越来越大,但标记数据的有限可用性限制了其充分利用这种增强能力的能力[5]。3)通用性的扩展规律:通过大规模的模型训练,研究人员发现,随着模型规模、数据集规模和的增加,模型性能的提高是可以预测的计算资源[6]。4)为下游任务节约成本:在之后进行预训练,利用有限的标注数据高效的微调,可以获得比特定任务人工智能模型。更优越的性能流行的基础模型(如GPT和Claude)在方面自然语言和图像处理,因此取得了成功将其对其应用于医疗保健领域。并进行重新设计是非常直观的基础模型在医疗保健领域的应用涉及多个子领域。首先,基础模型出色的自然语言处理能力有可能推动发展计算生物学的。DNA、RNA和蛋白质序列可被视为一种自然语言,而这些模型可以学习序列,中的模式从而深入了解基因组学。其次,药物研发利用基础模型加速靶点识别、优化分子设计、预测分子相互作用和特性,最终减少研发新药的时间和成本[7]。第三,在临床信息学,领域基础模型可以有效处理数百万甚至数十亿的临床和患者数据点,无论是结构化的还是非结构化的。它们可以从中患者的症状提取模式,从而更好地评估病情并制定个性化治疗方案。第四,医学影像分析可以利用基础模型来完成图像分割、异常检测和诊断预测等任务,从而提高诊断准确性和工作效率。最后,公共卫生在分析疾病监测、流行病学建模和错误信息检测的大型数据集时也能从基础模型中获益,从而促进更有效的公共卫生干预。因此,生物医学基础机会模型提升临床医生、研究人员和患者工作的正在稳步增加。 本调查旨在回顾生物医学领域现有的基础模型研究,总结其发展进展,找出生物医学基础模型近期面临挑战的,以启发潜在的再探索方向,并为研究人员推进其在健康科学中的。具体来说,应用提供基础我们将讨论多个生物医学领域的基础模型,包括计算生物学、药物发现与开发、临床信息学、医学影像和公共卫生(图1)。 2计算生物学 分子生物学的核心原理为提供了描述生物体内遗传信息的流动一个基础框架[9](图2)。基因组信息由DNA,编码转录为RNA,然后翻译成蛋白质。这一过程将DNA的四字母核苷酸代码转换成蛋白质的二十个氨基酸代码,蛋白质折叠成三维结构,执行各种细胞功能。理解中心教条对于促进发展遗传学、医学、生物技术和进化生物学。知识的至关重要它也是创新的基石。基因工程、基因治疗和药物开发因此,三维染色质遗传信息、RNA驱动的基因表达谱以及支撑细胞功能的是计算生物学的核心。本节探讨基础模型在这些的应用,蛋白质结构等主题领域包括基因组信息、基于RNA的基因表达谱以及蛋白质结构和功能。研究 图1:概览不同生物医学领域。的基础模型基础模型首先以自我监督的方式。使用海量无标记数据进行预训练然后,它可以很容易地适应各种下游应用,包括计算生物学、药物发现、公共卫生、医学成像和临床信息学。 基因组信息蛋白质合成的遗传密码是通用的,但的调控密码却因支配基因表达的时间和方式细胞类型和生物体而异[10]。这种调控代码主要存在于非编码DNA区域,约占基因组的98%,包括增强子、启动子和绝缘体。等关键功能元件这些元件调控基因表达和抑制活动,因此研究非编码DNA对了解基因调控、至关重要发育、疾病和进化。认识到DNA,的巨大潜力和影响人们开发了基础模型,以加深我们对DNA语言的理解。BigBird[11]开创先河通过开发了较长序列序列。的转换器,DNA编码的在之后这项工作,一系列DNA语言模型被开发出来,并为各种下游任务提供了强大的能力,包括RNA表达、增强子活性预测等。其他最新研究见表1。为了公平地比较不同的模型,GenBench [12]提出了一个全面的基准测试套件来比较不同的基因组基础模型。在研究一维DNA序列的,同时最近还提出了HiCFoundation [13],用于研究三维DNA及其功能影响。这些基础模型有助于理解基因组序列和结构对基因调控和影响表达的。 通过分析RNA基因表达谱表达谱基因[14]是基因基因活动。的的直接反映,对了解动态活动很有价值通过量化和比较不同样本或条件下RNA分子丰度,基因表达谱分析可以识别开启或关闭、差异表达或参与特定生物过程的基因。传统的批量RNA测序提供的是平均基因表达谱,掩盖了细胞的异质性,可能会掩盖重要信息。与此相反,单细胞RNA测序(scRNA-seq)通过分析单个细胞水平的。SCimilarity表达,可以详细了解细胞的多样性和可变性[15]是单细胞图谱,可最具代表性的基础模型之一用于比较不同单细胞RNA测序数据集中。转录相似的细胞其他相关 表2列出了这些基础模型。从这些基础中衍生出的基因和细胞嵌入模型大大推进了我们对不同细胞类型,中基因表达动态的理解为阐明发育、疾病和治疗反应。的分子基础带来了巨大的潜力 蛋白质蛋白质蛋白质结构与和蛋白质设计三维结构功能的预测在方面促进我们理解对生物过程的发挥着至关重要的作用[16],的三维结构决定了它们如何执行特定的功能,如催化反应、传递信号等。准确的预测可以揭示疾病的分子基础,并进一步指导药物发现。近年来,计算方法为填补结构知识空白、揭示分子水平的。生命复杂性提供了一种高效、可扩展的途径AlphaFold2 [17]是一个能高精度预测蛋白质结构的,它通过提供接近实验彻底改变了结构生物学大型模型水平的预测,,大大加速了对蛋白质功能和相互作用的研究。此外,在这些蛋白质结构预测,进展的基础上上蛋白质设计作为一门补充学科应运而生在此基础,研究人员创造出或设计具有特定功能或特性的。蛋白质蛋白质设计能够创造新型酶、治疗分子和药物,为医学、生物技术和合成生物学带来新的可能性,为疾病治疗和可持续工业流程。提供解决方案表3总结了结构预测和蛋白质设计的。蛋白质最新进展,包括大型模型和基础模型 3药物发现与开发 新型药物的开发对全球健康至关重要(图3)。药物发现和开发的目标是研制治疗某些人类疾病的新药。首先,(早期)药物发现要确定具有理想药物特性(如药物分子(设计或重复使用)吸收、排泄等)的。然后,(后期)药物研发通过来动物模型和临床试验。测试这些分子的安全性和有效性试验,将成功后药物接受美国食品及药物管理局等机构的监管审查,然后批准用于临床。本节将讨论药物发现中的一些基本问题和开发。早期药物发现的重点是药物分子结构,这涉及人工智能可解决的任务,如分子表征学习、药物药物特性预测、再利用和药物分子设计。人工智能在后期药物开发方面也有很大的变革潜力,特别是在建立预测性临床试验模型以指导临床试验专家方面。 分子表征学习与不同LLM,的预训练程序开发用于医疗保健的健康模型需要重点学习药物分子的。分子知识表征包含在中三种不同模式的信息源:分子结构、生物医学文档和知识库。本节回顾了分子表征学习的,并讨论了如何整合药物分子和医疗保健预训练,以改进药物推荐和疾病轨迹预测等下游任务[18]。自监督预训练方法表4列出了近期的研究成果。 药物特性预测分子特性预测旨在学习一个将分子结构映射到其药物特性的模型,这是新药的关键步骤发现。具体来说,药物的ADMET特性(吸收、分布、代谢、排泄和毒性)指是决定药物的吸收、体内分布、体内、体内排泄以及潜在毒性或不良反应的。代谢特性评估和了解ADMET特性有助于预测药物在体内的表现,识别潜在风险和相互作用,优化给药方案,确保患者的安全和疗效。在药物开发过程中,采用了来研究和评估这些特性。各种实验和计算方法预训练方法已广泛应用于药物性质预测。,ChemBERTa 基于BERT的架构,在来自PubChem的7700万个未标注SMILES字符串上进行预训练,然后微调,在上进行较小的标注数据以进行属性预测[19]。表5性质预测的。对有关近期药物研究进行了回顾 药物再利用利用再使用药物再又称药物或药物再定位,是指为药物。寻找新的医疗用途的过程与开发全新的药物相比,它正变得越来越有利,原因:如下成本、更低开发时间更短、风险更低[20]。Zhu et al.[21]证明,图神经网络(GNN)的性质使其成为理想架构,发现药物用途的从而引发了更多使用GNN的。研究表6。列出了最近的研究成果 预测性临床试验临床试验又称药物开发,旨在评估治疗人类。特定疾病的药物的安全性和有效性然而,众所周知,开展临床试验耗时、耗力且成本高昂。平均而言,这一过程需要7-11年时间,耗资约20亿美元,批准率低至约15%[22,23]。考虑到这些先决条件,将机器学习融入临床试验过程有可能减少人工劳动,并显著提高药物开发的。可扩展性,[24]设计了一个分层交互网络(HINT),该网络在上多模态药物数据进行预训练,并模拟临床试验的各个组成部分,以预测试验。结果表7列出。了一些预测性临床试验模型的基础模型 4临床信息学 临床信息学数据包含有关病史、治疗和广泛信息病人。健康相关活动的这些记录对于医护人员提供有效护理和管理病人健康。至关重要临床信息学,中有几项基本的人工智能可解决任务它们是 如图4所示,(如患者相似性)和治疗效果估计。根据数据类型:,自然语言问题可分为两类(1)基于文本的问题问题,如,如临床总结和临床问题解答(QA);(2)基于记录的健康患者表示具体来说,自然语言是医生和患者之间最常用的交互方式,因此临床总结和问题解答可以减轻医生的工作量,促进患者护理。,基于记录的健康任务可以提供更多的见解,从而医生进行诊断。帮助 临床摘要自动文本摘要是对单篇或多篇文档创建简明连贯摘要的过程,旨在节省获取关键信息的。时间该领域的现有方法大致可