登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
2023年大规模语言模型中语言与知识报告
文化传媒
2024-11-14
张奇
复旦大学
ZLY
MultilingualBERT中存在多语言对齐现象
mBERT不同层恢复各类语言语法关系的准确性。
mBERT第7层的不同语法关系表示的可视化。
在进行任务Fine-Tune之后,聚合对齐更加明显。
大语言模型中多语言对齐
大语言模型中也存在类似多语言对齐现象。
语言直接在句法关系上具有很强的对齐性。
词性标注任务,可以通过跨语言训练得到非常高的结果。
通过多语言模型预训练,多语言语义在模型中已经完成对齐。
大规模语言模型中多语言对齐
比较如下模型:LLaMA、LLaMA2、ChineseLLaMA、Open ChineseLLaMA、LLaMA+10K、LLaMA+100K、LLaMA+1M。
TOKEN扩展对模型影响很大,扩展后丢失原始信息,需要大量训练才能恢复。
SFT数据量扩展到950K后,1M这种量级二次预训练没有特别的意义。
使用中文进行二次预训练并不能在知识层面提升模型能力。
在其他低资源语言中表现很类似。
训练过程中非常明显的CODING-SWITCH现象。
大语言模型中的语言与知识
大语言模型参数中记录了知识有明显的语言核心区。
如何确定模型中的语言核心区和非核心区:
使用阿拉伯语、韩语、西班牙语、中文、俄语、越南语,每个语言10W条文本进行二次预训练。
6种语言训练前后参数变化累加,权重变化最小的1-5%。
随机扰动恢复实验:
扰动核心区域在30种语言上PPL全都呈现爆炸趋势。
LLaMA27B和13B现象完全一样。
使用中文的进行训练后,中文能力都可以恢复,模型具备一定的“代偿”能力。
在语言区不锁定的情况下,仅训练中文,英文也能恢复一定能力,但是锁定情况下很难恢复。
大模型中的语言核心区展示
Layer15-upLayer20-upLayer25-upLayer31-upFFN-UP&Down某些维度上具有明显的列聚集现象。
LLaMA2-13BLayer39-o维度集中现象明显。
仅修改130亿参数中的1个就会使模型混乱。
二次预训练方法
大量数据二预训练需要配比各类型其他数据。
大模型语言关键区域参数很敏感。
训练数据噪音敏感。
你可能感兴趣
开源视角下看大规模语言模型研发中的数据工程、自动化评估及与知识图谱的结合
信息技术
DataFunSummit2023:大模型与AIGC峰会
2023-08-08
关于大规模语言模型在科学研究中的应用综述
信息技术
未知机构
2025-02-26
大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向
佐治亚大学&德克萨斯大学阿灵顿分校
2025-04-22
全面召回?评估大型语言模型的宏观经济知识
美联储&卡内基梅隆大学
2025-06-24
全面召回?大型语言模型的宏观经济知识评价(英)
文化传媒
美联储
2025-07-06
预算有限情况下的大型语言模型:用于高效分类大型文本语料库的主动知识蒸馏
文化传媒
美国联邦储备委员会
2025-12-30
提升大型语言模型获取知识的可靠性
信息技术
斯坦福
2026-03-28
大规模语言模型从理论到实践
未知机构
2023-09-10
在大规模语言模型时代构建自主系统
加州大学伯克利分校电气工程与计算机科学
2024-12-19
ELEPHANT:大型语言模型中社会式谄媚的测量与理解
信息技术
斯坦福大学&卡内基梅隆大学&牛津大学
2025-09-29