登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
当大型语言模型遇上编程:代码智能的崛起
2024-01-26
深度求索AI&北京大学
Good Luck
DeepSeek-Coder 系列开源代码模型
核心贡献
DeepSeek-Coder 系列
:推出了一系列开源代码模型,规模从 1.3B 到 33B 不等,在 2 万亿个 token 上进行从头训练。
预训练数据
:使用高质量项目级代码语料库进行预训练,并采用带有 16K 窗口的填空任务提升代码生成与填充能力。
性能表现
:在多个基准测试中实现了开源代码模型的顶尖性能,并超越了现有的封闭源模型如 Codex 和 GPT-3.5。
许可证
:采用宽松许可证,允许进行研究和不受限制的商业使用。
数据收集
数据来源
:收集了 2023 年 2 月之前在 GitHub 上创建的公共仓库,仅保留 87 种编程语言。
数据过滤
:应用了与 StarCoder 项目相似的过滤规则,初步筛选出质量较低的代码,数据总量减少至原始规模的 32.8%。
依存句法分析
:解析文件间的依赖关系,并按依赖关系对文件进行排序,增强预训练模型对代码库内跨文件上下文的理解能力。
质量筛选
:采用编译器和质量模型,结合启发式规则,进一步过滤低质量数据。
数据去重
:在代码库级别而非文件级别进行近似去重,确保代码库结构的完整性。
n-gram 过滤
:实施 n-gram 过滤过程,确保训练数据不被 GitHub 上可能存在的测试集信息污染。
培训策略
训练目标
:采用下一个令牌预测损失和填充中间(FIM)方法。
FIM 方法
:将文本随机分为三部分,然后打乱这些部分的顺序并用特殊字符连接,增强模型的代码补全能力。
上下文长度
:将上下文长度扩展至 16K,使模型能够处理更复杂和广泛的编码任务。
模型架构
:开发了一系列具有不同参数的模型,包括 1.3B、6.7B 和 33B 参数的模型,基于 DeepSeek-AI 框架构建。
分词器
:采用 HuggingFace Tokenizer 库训练字节对编码(BPE)分词器,配置了 32,000 词汇量。
优化器
:使用 AdamW 优化器,并实施三阶段学习率调度策略。
训练环境
:使用 HAI-LLM 框架,结合多种并行性策略优化计算效率。
实验结果
代码生成
:DeepSeek-Coder-Base 33B 在 HumanEval 和 MBPP 基准测试中表现优异,分别达到 50.3% 和 66.0% 的准确率。
DS-1000 基准
:在涵盖七种不同库的 1000 个实用且现实的数据科学生成工作流程集合上,DeepSeek-Coder 模型在所有库中都实现了相对较高的准确率。
LeetCode 竞赛基准
:DeepSeek-Coder-Instruct 6.7B 和 33B 在该基准测试中分别达到了 19.4% 和 27.8% 的 Pass@1 得分,超越了现存的 Code-Llama-33B 等开源模型。
FIM 代码补全
:DeepSeek-Coder 模型在 Single-Line Infilling 基准测试中超越了其他开源模型,展现了其代码补全能力。
跨文件代码补全
:在 CrossCodeEval 基准测试中,DeepSeek-Coder 在多语言跨文件补全任务中始终优于其他模型。
基于项目的数学推理
:DeepSeek-Coder 模型在程序辅助数学推理任务中表现卓越,特别是在 33B 变体中。
指令调优
DeepSeek-Coder-Instruct
:通过使用高质量数据对 DeepSeek-Coder-Base 进行基于指令的微调,开发了 DeepSeek-Coder-Instruct。
性能提升
:DeepSeek-Coder-Instruct 33B 在一系列与编程相关的任务中超越了 OpenAI 的 GPT-3.5 Turbo。
进一步预训练
DeepSeek-Coder-v1.5
:基于 DeepSeek-LLM 7B 检查点进行额外预训练,处理包含自然语言、代码和数学数据的多样化数据集。
性能提升
:DeepSeek-Coder-Base-v1.5 模型在大多数任务上表现出显著优势,特别是在数学推理和自然语言处理能力上。
结论
DeepSeek-Coder 系列
:在代码生成、FIM 代码补全、跨文件代码补全和基于项目的数学推理等任务上表现优异,超越了现有的开源代码模型。
指令调优
:DeepSeek-Coder-Instruct 在编程相关任务中超越了 OpenAI 的 GPT-3.5 Turbo。
进一步预训练
:DeepSeek-Coder-v1.5 模型在数学推理和自然语言处理能力上显著提升。
未来方向
:开发和公开分享更多基于更大规模通用 LLMs 的更强大的以代码为中心的 LLMs。
你可能感兴趣
DeepSeek - Coder :当大型语言模型遇到编程时 - 代码智能的兴起
信息技术
DeepSeek&北京大学
2024-01-26
大型语言模型遇到编程时的编码器 - 代码智能的兴起
信息技术
DeepSeek
2025-02-06
当大型语言模型发展语言:为高效多智能体推理的符号通信
信息技术
中国科学院计算技术研究所人工智能安全国家重点实验室
2026-07-14
【电报解读】工信部要求加快智能编程研发应用!机构称AI代码工具已成为业内提效的关键手段,未来行业规模有望突破3500亿,这家公司通过会员订阅制模式有效促进了先进工业AI软件的应用落地-20260429
未知机构
2026-04-29
2026少儿编程新动向:当代码走出屏幕,国产机器人如何接棒?
无
2026-06-20
大型语言模型的自动化越狱
文化传媒
EPAM
2025-07-25
全面召回?大型语言模型的宏观经济知识评价(英)
文化传媒
美联储
2025-07-06
基于大型语言模型的智能体的兴起与发展
信息技术
复旦大学
2023-09-14
三小时掌握大型语言模型的公平性
信息技术
FIU
2024-11-24
ELEPHANT:大型语言模型中社会式谄媚的测量与理解
信息技术
斯坦福大学&卡内基梅隆大学&牛津大学
2025-09-29