登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
大型语言模型遇到编程时的编码器 - 代码智能的兴起
信息技术
2025-02-06
-
DeepSeek
章嘉艺
DeepSeek-Coder 系列开源代码模型研报总结
核心贡献与模型介绍
DeepSeek-Coder 系列
:推出了一系列开源代码模型,规模从 13 亿到 330 亿不等,基于 2 万亿个标记从头开始训练。
预训练数据
:在高质量的项目级代码语料库上进行预训练,采用 16K 窗口的填空任务(FIM)增强代码生成和填补能力。
模型架构
:基于 DeepSeek-AI 框架构建的解码器型 Transformer,采用旋转位置嵌入(RoPE),部分模型集成分组查询注意力(GQA)。
训练策略
:结合 Next Token 预测和 FIM 训练目标,并通过指令微调提升模型在代码相关任务中的表现。
数据收集与处理
数据来源
:GitHub 上的公共仓库,涵盖 87 种编程语言,总数据量为 798 GB,包含 6 亿个文件。
数据预处理
:应用规则过滤低质量代码,进行依赖关系解析,仓库级别去重,以及质量筛选和去污。
数据集构成
:87% 源代码、10% 英语代码相关自然语言语料库、3% 中文自然语言语料库。
实验结果与评估
代码生成
:DeepSeek-Coder-Base 33B 在 HumanEval 和 MBPP 基准测试中表现优异,超越了所有现有的开源代码 LLM。
FIM 代码完成
:DeepSeek-Coder 模型在 FIM 基准测试中表现突出,50% FIM 率下达到最佳性能,但与代码完成能力存在权衡。
跨文件代码完成
:DeepSeek-Coder 在 CrossCodeEval 基准测试中超越其他模型,展示了其在跨文件代码理解上的优势。
程序基础的数学推理
:DeepSeek-Coder 在多个数学推理基准测试中表现优异,证明了其在复杂数学计算和问题解决能力上的潜力。
指令微调
:DeepSeek-Coder-Instruct 模型在多个基准测试中超越 GPT-3.5 Turbo,展示了其在代码生成和理解方面的卓越能力。
长上下文处理
:通过扩展 RoPE 参数,模型能够处理 16K 令牌的上下文,增强了其在仓库级别代码处理等场景中的实用性。
研究结论
性能表现
:DeepSeek-Coder 系列模型在多个代码相关任务中超越了现有的开源代码 LLM,部分模型甚至超越了闭源模型。
模型效率
:DeepSeek-Coder-Base 6.7B 模型在代码补全任务中表现优异,展示了其在效率与准确性之间的良好平衡。
未来展望
:基于更大规模的通用 LLM 开发更加强大的以代码为中心的 LLM,进一步提升模型的自然语言理解和数学推理能力。
你可能感兴趣
DeepSeek - Coder :当大型语言模型遇到编程时 - 代码智能的兴起
信息技术
DeepSeek&北京大学
2024-01-26
当大型语言模型遇上编程:代码智能的崛起
深度求索AI&北京大学
2024-01-26
基于大型语言模型的智能体的兴起与发展
信息技术
复旦大学
2023-09-14
基于大型语言模型的代理的兴起和潜力:一项调查
信息技术
复旦NLP集团
2025-01-07
基于大型语言模型的代理的兴起和潜力: 一项调查
复旦NLP集团
2023-09-01
【电报解读】工信部要求加快智能编程研发应用!机构称AI代码工具已成为业内提效的关键手段,未来行业规模有望突破3500亿,这家公司通过会员订阅制模式有效促进了先进工业AI软件的应用落地-20260429
未知机构
2026-04-29
大型语言模型的自动化越狱
文化传媒
EPAM
2025-07-25
全面召回?大型语言模型的宏观经济知识评价(英)
文化传媒
美联储
2025-07-06
三小时掌握大型语言模型的公平性
信息技术
FIU
2024-11-24
ELEPHANT:大型语言模型中社会式谄媚的测量与理解
信息技术
斯坦福大学&卡内基梅隆大学&牛津大学
2025-09-29