概述
本次研报探讨了大型语言模型(LLMs)在科学领域的应用,重点关注科学文本、脑信号和生物序列三个方面的进展和挑战。
科学文本
- LLMs 在科学领域的应用现状:已有大量科学 LLMs 被构建,涵盖多个学科领域(如数学、物理、化学、生物医学等)和多种模态(如文本、图、视觉、时间序列)。
- 关键研究成果:例如 Med-PaLM 2 在医学问答任务中达到专家水平,OpenAI o1 在博士级别的科学问题中超越人类表现。
- 挑战:LLMs 在复杂任务、多模态融合和可信度方面仍面临挑战。例如,研究发现 LLMs 在临床决策中表现不如临床医生,且对信息量和顺序敏感。
- 未来方向:包括复杂推理和规划、多模态学习以及 LLMs 的可信度提升。
脑信号
- 脑机接口(BCI)技术:BCI 技术实现大脑与外部设备之间的直接通信,其中脑电图(EEG)信号具有高时间分辨率但低空间分辨率的特点。
- 脑基础模型:基于大规模公开 EEG 数据构建了多个脑基础模型,如 BrainBERT、MMM 和 LaBraM,用于下游任务如异常检测和脑到文本翻译。
- EEG 到文本翻译:EEG2Text 模型能够将 EEG 信号解码为自然语言句子,为脑机接口应用提供新的可能性。
- 未来方向:包括更好的时空信号编码、EEG 基础模型的个性化以及多模态脑基础模型。
生物序列
- 分子生物学基础:介绍了 DNA、RNA 和蛋白质的基本结构和功能,以及转录和翻译过程。
- 生物序列建模:利用机器学习技术对生物序列进行建模,构建 DNA 语言模型、RNA 语言模型和蛋白质语言模型。
- 基因组规模建模:Evo 模型是一个基于大规模基因组数据训练的模型,能够理解整个细胞的活动。
- 多模态学习:ProtST 模型结合了蛋白质序列和生物医学文本进行多模态预训练,在多种下游任务中表现出色。
- 未来方向:基因组规模 LLMs 的发展,以及利用文本桥接不同分子功能。
结论
LLMs 在科学领域具有巨大的潜力,但仍面临诸多挑战。未来研究方向包括复杂推理和规划、多模态学习以及 LLMs 的可信度提升。生物学领域是 LLMs 的下一个前沿,基因组规模 LLMs 能够理解整个细胞的活动,文本可以作为桥接不同分子功能的工具。