登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
预算有限情况下的大型语言模型:用于高效分类大型文本语料库的主动知识蒸馏
文化传媒
2025-12-30
-
美国联邦储备委员会
冷水河
核心观点
大型语言模型(LLM)在文本分类任务中表现出色,但其高昂的计算和财务成本限制了其在动态环境中的大规模部署。
知识蒸馏(KD)技术可以将LLM的知识迁移到更小、更高效的模型中,但蒸馏过程本身对大型数据集仍然昂贵。
本研究探索将主动学习(AL)与知识蒸馏结合,以在降低成本的同时保持LLM的性能。
关键技术
知识蒸馏
:使用高性能的“教师”LLM训练更小、更高效的“学生”模型。
主动学习
:智能地选择数据点进行标注,以最小化标注成本并最大化模型性能。
M-RARU(多类随机接受/拒绝不确定性采样)
:一种新的主动学习算法,通过接受/拒绝机制选择最具信息量的样本进行标注。
实验设置
数据集
:公共评论数据集和LSEG数据与分析的全球新闻存档数据库(GNAD)。
学生模型
:支持向量机(SVM)、线性判别分析(LDA)、随机森林(RF)、梯度提升决策树(GBDT)和DistilBERT。
主动学习方案
:随机采样(RANDOM)和M-RARU。
评估指标
:准确率和平衡准确率。
研究结论
M-RARU在多个基准数据集上显著优于随机采样,提高了学生模型的准确率和平衡准确率。
M-RARU在降低标注成本的同时,实现了与LLM相当的性能。
基于树的学生模型(RF和GBDT)受益最大,而基于线性模型(SVM和LDA)的学生模型也表现出显著的改进。
M-RARU的采样效率高于传统的不确定性采样方法。
传统机器学习模型(GBDT、RF、LDA、SVM)的训练和推理效率远高于基于Transformer的DistilBERT模型。
研究意义
本研究提出的方法为开发快速、准确且高效的文本分类器提供了一种实用途径。
通过结合知识蒸馏和主动学习,可以显著降低LLM在文本分类任务中的成本,使其更易于部署和应用。
你可能感兴趣
大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向
佐治亚大学&德克萨斯大学阿灵顿分校
2025-04-22
全面召回?评估大型语言模型的宏观经济知识
美联储&卡内基梅隆大学
2025-06-24
全面召回?大型语言模型的宏观经济知识评价(英)
文化传媒
美联储
2025-07-06
提升大型语言模型获取知识的可靠性
信息技术
斯坦福
2026-03-28
BloombergGPT:一个用于金融的大型语言模型
信息技术
未知机构
2023-04-04
当大型语言模型发展语言:为高效多智能体推理的符号通信
信息技术
中国科学院计算技术研究所人工智能安全国家重点实验室
2026-07-14
自动化证据综合:用于数据提取的大型语言模型的比较评估(英)
机械设备
亚开行
2026-05-01
用于能源系统研究的大型语言模型
信息技术
NREL
2023-11-15
大型语言模型 ( LLM ) 威胁性分类
文化传媒
CSA
2024-07-02
金融工程专题报告:基于知识蒸馏的AI选股模型优化
金融
财通证券
2026-05-25