登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
DeepSeek完全实用手册:技术原理·使用技巧·部署进展
信息技术
2025-04-15
-
至顶科技&至顶AI实验室&至顶智库
大王雪
一、DeepSeekV3模型更新
来源
: DeepSeek,至顶AI实验室整理
时间
: 2025年3月24日
简介
: DeepSeek-V3模型开源发布,与之前的DeepSeek-V3使用相同的base模型,仅改进了后训练方法。
参数
: 约660B
上下文长度
: 开源版本上下文长度为128K(网页端、App和API提供64K 上下文)。
更新亮点
:
推理能力提升
: 借鉴DeepSeek-R1模型训练过程中的强化学习技术,大幅提高在推理类任务上的表现水平,在数学、代码类相关评测集上取得了超过GPT-4.5的得分成绩。
前端开发能力增强
: 在HTML等代码前端任务上,生成的代码可用性更高,视觉效果也更加美观、富有设计感。
中文写作升级
: 基于R1的写作水平进行了进一步优化,特别提升了中长篇文本创作的内容质量。
中文搜索能力优化
: 在联网搜索场景下,对于报告生成类指令输出内容更为详实准确、排版更加清晰美观的结果。
其他提升
: 工具调用、角色扮演、问答闲聊等方面也得到一定幅度的能力提升。
二、DeepSeek部署进展
地方政府
: 全国已有超过70%的地方政府(包括四大直辖市国企)完成DeepSeek模型部署,应用场景涵盖智能问答、公文起草、政务服务、知识库、政策咨询、智能客服、12345热线等方面。
央企
: 全国98家央企中已有60家(集团或下属公司层面)完成DeepSeek模型部署,应用场景涵盖办公、能源、制造、通信、航运等多领域。
地方国企
: 我国四大直辖市国企(北京、上海、天津、重庆) 40+企业已全面部署DeepSeek模型,应用涵盖生产制造、金融创新、智能汽车、交通运营、水务管理等多个领域。
智能终端
: DeepSeek模型在智能手机、AI PC、智能家电、智能汽车等多个智能终端领域得到部署,主要集中在语音交互、智能问答、AI助手、智能座舱等方面。
三、DeepSeek技术路线解析
模型类型
: DeepSeek拥有通用模型(V3)和推理模型(R1)。
关键技术
:
混合专家架构(MoE
): V3和R1模型均采用MoE架构,每个MoE层包含1个共享专家和256个路由专家,在运行时每个词元只激活8个路由专家,有效节约计算资源。
多头潜在注意力(MLA
): 对注意力键和值进行低秩联合压缩,减少推理过程中的键值缓存(KV cache),从而降低推理时的内存占用。
多词元预测训练(MTP
): 在训练过程中,模型不仅预测下一个词元,同时预测多个未来的词元,通过在共享模型主干上增加多个独立的输出头来实现。
FP8混合精度训练
: 使用细粒度量化策略、低精度优化器状态等方法以实现增强精度、低精度存储和通信。
强化学习中的群体相对策略优化(GRPO
): 对PPO改良,提高计算效率,降低内存占用。
开源程度
: DeepSeek属于大模型开源级别,完全公开模型权重、训练数据、代码等,并支持社区协议。
四、DeepSeek调用与部署
调用方式
: 可通过云端调用和本地部署的方式使用。
云端调用
: 可通过官方API或第三方API直接调用DeepSeek R1模型服务并接入业务中;或者可以在云平台上创建、部署、微调模型,再通过API连接模型调用。
本地部署
: 需下载DeepSeek R1满血版或蒸馏版本模型,通过Ollama、vLLM等工具启动模型,并借助可视化界面工具与用户交互。
部署方案
: 市面上有多家厂商提供DeepSeek一体机方案,如新华三、浪潮、中科曙光、超聚变、联想等。
五、如何使用DeepSeek
使用范式
: 独立使用、工具组合使用。
独立使用
: 通过自然语言对话获取核心服务,典型场景包括文本创作、信息咨询、知识推理等。
工具组合
: 基于文本指令驱动的工具生态协同,实现“DeepSeek+”创新工作流,例如办公增效、创意设计、AI音视频、编程辅助等。
提示工程
: 通过优化输入指令(提示词),引导AI模型生成更精准、高质量的输出。
六、趋势判断
开源模型
: 将推动AI应用生态的加速繁荣,大幅降低传统企业与创业者接入AI的成本与门槛。
推理模型
: 或将成为主流形态,在精准度与成功率方面表现突出,且可解释性强。
AI算力平台
: 每项业务都需要接入至少一种AI模型,每位工作者都需要能跑端侧AI的个人电脑,每个公司都需建设能支撑AI工作流的AI算力平台。
“Agent+协议”
: 可能是企业应用的新范式,Agent将自主规划任务步骤、调用合适工具、判断完成情况。
七、DeepSeek最新动向
开源代码库
: 2025年2月24日起,DeepSeek启动开源周,连续5天总共开源8个代码库,包括FlashMLA、DeepEP、DeepGEMM、DualPipe、EPLB、profile-data、3FS、Smallpond等。
新模型
: 2025年4月3日,DeepSeek发布新论文Inference-Time Scaling for Generalist Reward Modeling,新模型DeepSeek-GRM准备开源,论文先行。GRM在各种RM基准测试中优于现有方法和模型,并且比训练时缩放相比性能更好。
你可能感兴趣
DeepSeek完全实用手册V1.5-技术原理·使用技巧·部署进展
至顶科技&至顶AI实验室&至顶智库
2024-04-26
DeepSeek完全实用手册——从技术原理到使用技巧
信息技术
至顶
2025-02-26
深度解读DeepSeek:部署、使用、安全
信息技术
天津大学
2025-03-06
深度解读DeepSeek:部署、使用、安全
天津大学自然语言处理实验室
2025-08-27
2025大模型原理、技术与应用:从GPT到DeepSeek
信息技术
哈工大计算学部
2025-02-28
Hermes Agent 完全技术参考手册:从入门到生产部署
信息技术
Nous Research&清华大学清新研究团队&解数咨询&D17&花叔橙皮书
2026-06-14
中国宏观经济月报:DeepSeek的抄袭争议——蒸馏技术的使用
致富证券
2025-02-11
GenAI:74.6%的中国财富500强企业正在部署或使用GenAI技术
信息技术
第一上海证券
2025-09-23
如何向ChatGPT提问以获得高质量答案:提示技巧工程完全指南
未知机构
2023-04-13
DeepSeek如何赋能职场应用——从提示语技巧到多场景应用(0212)
信息技术
清华大学
2025-02-12