登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
2024年大语言模型理论与实践报告
信息技术
2024-11-14
张奇
复旦大学
路仁假
大语言模型主要内容及关键数据总结
1. 语言模型基础
定义
:语言模型(Language Model, LM)的目标是构建词序列 (w_1w_2...w_m) 的概率分布 (P(w_1w_2...w_m)),即计算给定词序列作为句子出现的可能性大小。
应用
:如“复旦大学有四个校区:邯郸、江湾、张江、枫林” 概率为0.95,“复旦大学校区四共上海在” 概率为0.0024。
2. ChatGPT的强大之处
生成机制
:ChatGPT的核心任务是生成一个“合理的延续”,即根据已有文本生成符合人类书写习惯的下一个合理内容。
模型结构
:使用循环神经网络(RNN)、卷积神经网络(CNN)、端到端记忆网络等神经网络方法进行建模。
3. 语言模型的类型
n-gram模型
:当前词的概率只依赖于前面 (n-1) 个单词,如2-gram和3-gram模型。
神经语言模型
:使用前馈神经网络和词嵌入(Word Embedding)进行建模,如GPT系列。
4. 大模型训练
数据来源
:包括图书、百科、网页等,如GPT-3使用了CommonCrawl、WebText2、Books1等数据集。
训练资源
:使用上千张GPU,训练时间长达几个月,如GPT-3使用1000+ GPU,训练时间约一个月。
并行训练
:采用分布式架构,如BLOOM使用992块NVIDIA A100 GPU,训练时间近两个月。
5. 指令微调
定义
:在预训练模型基础上,使用有标注的特定任务数据进行进一步微调,以让模型具备遵循指令的能力。
训练数据
:百万用户指令和对应的答案,如MOSS、ChatGLM6b等。
6. 强化学习
方法
:通过奖励函数和强化学习方法进行训练,如ChatGPT、Claude。
挑战
:包括高质量标注数据、稳定分类或排序模型、与强化学习训练过程结合等问题。
7. 大模型的认知
能力涌现
:能力的涌现可能只是评价指标的问题,而非真正的能力提升。
推理能力
:大模型在逻辑推理任务上仍需改进。
应用场景
:并非所有场景都需要千亿级别的大模型,具体任务可根据需要选择合适的模型。
8. 大语言模型的优势
文本建模能力
:能够理解和生成3.2万长度的Token。
多任务统一学习
:将所有NLP任务统一到生成式多任务学习框架。
任务泛化能力
:在多种任务上表现出良好的泛化能力。
9. 新的范式
大模型带来的变革
:改变了传统的机器学习流程,实现了更高效的文本处理和生成。
小模型时代的结束
:新的范式使得模型更加智能化和多样化。
你可能感兴趣
2024年社会化共享用工理论与实践研究白皮书
公用事业
用友薪福社
2024-06-12
《携手迈向生态友好的现代化——习近平生态文明思想对全球可持续发展的理论贡献与实践引领》智库报告发布
信息技术
信达证券
2025-11-23
加强不动产领域的国际财政透明度——实践理论:经合组织与G20中央银行财政部长和政府官员的意图报告
金融
经济合作与发展组织
2024-07-25
货币流动性系列报告六:中国货币政策传导框架:理论、实践与展望
山西证券
2024-07-12
中国式现代化理论与实践创新引领我国未来发展之路——二十届三中全会会议精神专题解读系列报告
大公信用
2024-07-19
刘逸伦-打造自适应AI运维智慧体大语言模型在软件日志运维的研究与实践
信息技术
2024AI研发数字峰会AiDD北京站
2024-11-17
宏观观察2024年第01期(总第510期):从理论和实践视角研判中国经济潜在增速
中国银行
2024-01-02
2024年基于大语言模型的新型电力系统运行与仿真初探报告
信息技术
香港中文大学(深圳)
2024-12-23
2024年大语言模型的能力边界与发展思考报告
文化传媒
复旦大学
2024-11-14
获得遗传资源和利益分享:名古屋议定书下的理论与实践
信息技术
UNDP
2020-07-14