概述
本研报探讨了大型语言模型(LLMs)在科学领域的应用,重点关注科学文本、脑信号和生物序列三大方向。报告首先介绍了LLMs的基本概念及其在机器翻译、对话系统等领域的应用,并指出科学数据与语言具有相似性,为LLMs在科学领域的应用提供了基础。报告随后详细阐述了科学LLMs的挑战与机遇,包括复杂推理与规划、多模态学习以及LLMs的可信度问题。
科学文本
报告回顾了科学LLMs的最新进展,包括Med-Palm-2、OpenAI o1等模型在科学问答方面的突破。同时,报告也指出了LLMs在临床决策中的局限性,例如诊断准确率低于临床专家,对信息量和顺序敏感等。为解决这些问题,报告介绍了TriageAgent模型,该模型通过多智能体协作提升了LLMs在临床分诊中的表现。
脑信号
报告重点介绍了基于脑电图(EEG)的脑LLMs,包括BrainBERT、MMM和LaBraM等模型。这些模型在脑到文本翻译任务中取得了显著成果。报告还分析了EEG数据的特性,如时空序列、高时间分辨率但低空间分辨率以及低信噪比等,并提出了未来研究方向,包括更好的时空信号编码、EEG模型的个性化以及多模态脑LLMs的构建。
生物序列
报告探讨了LLMs在生物序列领域的应用,包括DNA、RNA和蛋白质LLMs。报告介绍了DNABERT、GenSLMs、RNA-FM、ProteinBERT等模型在预测调控元件、RNA结构功能、蛋白质结构预测等任务中的应用。报告还重点介绍了单细胞LLMs,如scBERT、scGPT和scMVP等模型,这些模型在单细胞分析中表现出色,可用于细胞类型注释、轨迹推断和基因调控网络推理等任务。
未来方向
报告最后总结了LLMs在科学领域的未来发展方向,包括:
- 复杂推理与规划:通过多智能体LLMs提升复杂任务的解决能力。
- 多模态学习:系统性地整合网络、文本和图像等多模态数据,构建多模态生物序列LLMs。
- 可信度问题:系统性地评估和缓解LLMs在科学应用中的可信度问题。
报告强调了LLMs在推动科学发现中的巨大潜力,并展望了AI科学家和智能体实验室等未来应用场景。