DeepSeek V4Pro正式版:Agent能力跃升、Harness开放 2026年8月13日,DeepSeek V4 Pro正式版在APP、网页端和API同步上线,本次更新的核心不是继续扩大参数或上下文,而是把后训练重点转向生产环境中的Agent执行能力,并同时补齐Responses API、Codex适配和思考强度控制。V4 Pro采用MoE架构,总参数1.6T、单Token激活参数49B,原生支持100万Token上下文,API最大输出长度为384K;在100万Token上下文下,其单Token推理FLOPs和KV Cache分别约为DeepSeek-V3.2的27%和10%。相比4月预览版,正式版在HLE工具增强、TerminalBench 2.1、DeepSWE、Toolathlon-Verified和AutomationBenchPublic上分别提升24.5%、21.9%、389.8%、32.6%和148.4%。 价格方面,自北京时间8月17日0时起,DeepSeek改用峰谷定价,空闲时段价格为高峰时段的一半;以"100万未命中输入+20万输出"的长程Agent任务衡量,V4 Pro空闲/高峰成本约7.2/14.4元,空闲价约为Kimi K3的17%、ClaudeOpus 4.8的10%,即使高峰时段也仍约为Kimi K3的34%,成本优势依然明显。与正式版发布同期开放的DeepSeek Harness开发者预览版采用“一切皆插件”的开放架构,预置Standard、PTC、Minimal和Creator四种模式,并采用追加式会话日志记录系统提示词、推理、工具调用与返回等完整执行轨迹。总体来看,V4 Pro的竞争力已由单点模型转向模型—Harness协同。 DeepSeek V4 Pro三类金融投研任务实测 我们以估值建模、多因子回测和行业研究三个真实投研任务,对DeepSeek V4 Pro、Kimi K3和GLM-5.2三个模型进行了实测。估值任务中,Kimi K3排名第一,其收入预测按"分产品销量×单价"拆解,颗粒度最细,报告结论与目标价、评级一致;DeepSeek V4 Pro排名第二,报告口径更新、结论审慎,但Excel关键公式存在系统性错位,修改假设后无法可靠重算;GLM-5.2排名第三,工作簿核心公式异常、结论无法复核,存在明显冲突。 回测任务中,DeepSeek V4 Pro排名第一,扣除交易成本、明确区分信号日与执行日并剔除停牌,底稿完整、可逐期复核;Kimi K3排名第二,交付较完整,但未扣成本、未区分交易时点、未处理不可交易状态,高换手下收益可能被明显高估;GLM-5.2排名第三,毛净收益完全相同,相当于未扣成本,中间过程披露不足。 行业研究任务中,DeepSeek V4 Pro排名第一,投资框架可复算,Wiki沉淀了来源页、实体页与综合页,关键数据可追溯;Kimi K3排名第二,评分框架完整但Wiki沉淀不足;GLM-5.2排名第三,知识库覆盖面最大,但缺少评分权重与计算方法,结论无法还原,可核实性最弱。总体来看,三个模型在预测颗粒度、底稿可复核性、交易约束处理和来源追溯等方面仍存在明显差距。 风险提示 结果通过历史数据统计、建模和测算完成,历史规律不代表未来;在市场环境发生变化时,模型存在失效的风险;策略依据一定的假设通过历史数据回测得到,当交易成本或其它条件改变时,可能导致策略收益下降甚至出现亏损;大模型输出的内容存在一定的随机性和准确性风险;本文所提炼的观点,基于一定的提示词产生,大语言模型输出的结果可能随着提示词的变化而发生变化。部分应用本身可能存在一定的安全风险,在使用此类应用时,用户需自行承担由此可能引发的任何风险和后果。在使用AI生成内容时,需要注意相关版权问题。用户应确保所使用的工具及其生成的内容符合相关法律法规的要求,避免侵犯他人知识产权。 内容目录 一、DeepSeek V4 Pro正式版:Agent能力跃升、Harness开放........................................5 1.1正式版定位与架构基础...................................................................51.2 Agent能力跃升:公共基准对比...........................................................51.3 API价格调整与性价比分析...............................................................61.4 DeepSeek Harness:从模型能力到执行系统.................................................71.5小结:V4 Pro的竞争力由单点模型转向模型—Harness协同...................................9 2.1估值任务...............................................................................92.1.1各模型估值建模表现..................................................................102.1.2各模型估值任务能力总结..............................................................142.2回测任务..............................................................................152.2.1各模型回测任务表现..................................................................152.2.2各模型回测任务能力总结..............................................................192.3行业研究任务..........................................................................202.3.1各模型行业研究任务表现..............................................................212.3.2各模型行业研究任务能力总结..........................................................25 图表目录 图表1:DeepSeek V4 Pro正式版公开规格.........................................................5图表2:DeepSeek V4 Pro正式版相对预览版的Agent基准提升.......................................6图表3:前沿模型共同Agent基准对比............................................................6图表4:DeepSeek V4系列API价格调整(元/百万Token)..........................................6图表5:前沿模型API价格与场景成本对比........................................................7图表6:前沿模型能力—成本定位................................................................7图表7:DeepSeek Harness插件架构..............................................................8图表8:DeepSeek Harness四种运行模式..........................................................8图表9:估值任务prompt总要求.................................................................9图表10:估值任务分点要求(节选)............................................................10图表11:估值任务逻辑链......................................................................10图表12:DeepSeek V4 Pro交付的估值模型工作簿.................................................11图表13:DeepSeek V4 Pro交付的投资分析报告...................................................11 图表14:DeepSeek V4 Pro核心假设方式.........................................................11图表15:DeepSeek V4 Pro部分公式异常.........................................................11图表16:Kimi K3交付的估值模型工作簿.........................................................12图表17:Kimi K3交付的投资分析报告...........................................................12图表18:Kimi K3经营预测拆解逻辑.............................................................12图表19:Kimi K3部分公式异常.................................................................12图表20:GLM-5.2交付的估值模型工作簿.........................................................13图表21:GLM-5.2交付的投资分析报告...........................................................13图表22:GLM-5.2经营预测拆解逻辑.............................................................14图表23:GLM-5.2摘要页出现公式异常..........................................................14图表24:模型估值任务表现对比................................................................14图表25:回测任务Prompt总要求...............................................................15图表26:回测任务分点要求.................................................................