您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:国金金融工程DeepSeek-V4-Pro测评会议纪要 - 发现报告

国金金融工程DeepSeek-V4-Pro测评会议纪要

2026-08-17 未知机构 健康🧧
报告封面

发布时间:2026-08-17 一、核心要点 1. 2026年8月13日DeepSeek-V4-Pro正式版上线,采用MoE架构,总参数1.6万亿,单token激活490亿,原生支持100万token上下文,API最大输入384k,引入流行约束超连接方案优化网络稳定性,采用Muon优化器提升收敛效率,以M.P4、M.P8混合精度发布,支持OpenAI协议接口,具备Agent能力。 2. 正式版在HellaSwag、工作工具增强Terminal、bDPSWE等基准上较预览版提升20%以上,bDPSWE能力评分提升超3倍,7项Agent基准算术平均得分65,与Kimi K3的65.1持平,高于OpenAI o1的63.9、智谱GLM5.2的53,仅低于云雀FiBiFive的67.6。 3. API价格调整:预览版输出百万token仅6元,正式版8月17日后分闲/高峰时段,闲时段百万token输出13.5元(约为原2倍多),高峰时段27元(约为原4倍多);但在百万输入、20万输出的Agent任务场景,V4-Pro闲/高峰成本为7.2、14.4元,较KimiK3(42元)、OpenAI o1(70元)、FiBiFive(140元)成本优势仍明显,闲时仅为Kimi K3的17%、OpenAI o1的10%,高峰时为Kimi K3的34%。 二、关键产品功能 1. 新增Harness插件,是大模型与业务工具间的Agent运行时,可实现模型输出转工具调用、上下文管理、沙箱运行、多Agent编排、执行轨迹记录,采用全插件开放架构,具备模型与执行环境解耦、Agent能力从提示词工程升级为可组合软件组件的价值,提供标准/PDC/最小化/创造者4种模式,为执行环境与工作工具权限的组合。三、金融投研任务测评结果 1. 估值建模任务:以中际旭创为对象,V4-Pro交付自洽逻辑报告,预测采用分业务增速加总,虽存在Excel公式错位、模型不可调的问题,但报告及配套文件完善,整体预测质量不错,表现次于Kimi K3;智谱GLM5.2的底稿可用性差,核心公式异常、数据无法正常计算。 2. 多因子回测任务:基于沪深300成分股,V4-Pro能准确考虑信号日与执行日的滞后成交,考虑交易成本,11年1月至2026年6月的回测逻辑完善,因子处理合理,底稿详尽,报告质量高,表现优于Kimi K3、智谱GLM5.2,排名第一。 3. 半导体设备行业研究任务:以半导体设备产业链为对象,V4-Pro交付完整Markdown/HTML格式报告、可更新行业Wiki,覆盖主要环节与国内外龙头,建立公司映射关系,投资框架及知识库完善,表现优于Kimi K3、智谱GLM5.2,排名第一。四、结论与建议 1. DeepSeek-V4-Pro正式版Agent能力较预览版增量明显,虽API价格上涨,但成本优势仍显著,在回测、行业研究类金融投研任务中表现突出,推荐尝试使用。