您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:中信证券DeepSeek V4 Flash测评及国产大模型对比展望 - 发现报告

中信证券DeepSeek V4 Flash测评及国产大模型对比展望

2026-08-06 未知机构 silence @^^@💗
报告封面

发布时间:2026-08-06 一、会议基本情况 1. 本次会议为中信证券白名单会议,仅限受邀客户参与,未经许可不得对外传播内容二、核心测评信息 1. 测评涉及DeepSeek V4 Flash、Gemini 5.2(智谱GM5.2)、Moonshot Kimi 3(Kimi K3)、Mixtral 8x7B(Mixm3)四款大 模型2. 评价维度设定:前端占比35%、后端占比35%、质量占比30%的定量评价3. 实测综合排名:Kimi K3排名第一,GM5.2得分略高于DeepSeek V4 Flash,Mixm3因发布时间最久排第四,符合模型越新性能越强的判断 三、各模型关键参数与任务执行数据 1. DeepSeek V4 Flash:7月31日正式上线,参数2840亿(激活130亿),Pro版尚未发布仍在等待;在Cloud Code运行,耗时35分钟,消耗3500万Token,花费1.21元,缓存命中99%,性价比突出2. GM5.2:在自身Code运行,耗时18分钟,消耗1300万Token,适配B端开发场景,老套餐性价比高但新套餐提价后优势减弱3. Mixm3:在自身Agenti运行,耗时50多分钟,套餐定位量大管保、高性价比4. Kimi K3:完成任务时因Token耗尽充值补费,执行时间最长但完成效果最佳四、各模型核心优势与短板 1. DeepSeek V4 Flash:代码能力较前代提升,成本仅为竞品十分之一左右,成本优势显著;非代码场景能力接近GM5.2、弱于Kimi K3,存在指令遵循度、幻觉问题,付费用户为普惠型开发者,与智谱等高价值付费群体分化2. GM5.2:后端架构能力强、执行效率高,适配B端3. Mixm3:前端交互体验好、套餐性价比高4. Kimi K3:智能化水平高、任务完成效果好,代码能力领先,Multi-M3视觉还原度好;性价比及效率偏低 五、后续展望与行业判断 1. 期待8月发布的DeepSeek V4 Pro版,能力对标甚至超越OpenAI o4.82. 国产大模型下半年将呈第一梯队竞争格局,DeepSeek、Kimi或交替领先3. 当前国产模型核心瓶颈为算力短缺,DeepSeek提价或因调用量过大致基础设施承压,提价不影响C端用户,利于商业化4. 未来大模型不会一家独大,各模型有不同优势与擅长领域,欢迎投资人与中信计算机团队进一步交流 六、风险与关注 1. DeepSeek V4 Flash存在指令遵循度、幻觉问题2. Kimi K3性价比及效率偏低3. 国产大模型面临算力短缺的核心瓶颈4. DeepSeek提价后其普惠型开发者付费群体的接受度有待观察