2)实测低于个人预期。个人实测大约1.2亿token。前端类项目存在多轮动作修改不通的情况,而此前Flash一轮跑通。投研类项目可能找不到勾稽关系,而GPT5.6Sol可以一次过。复杂后端项目,V4 Pro正式版广但不够深,核心Agent循环能够运行,但存在假流式、工具串行等问题。个人认为实际效果在Opus4.6+(可能小样本)。 GPT5.6Sol+UltraCode做出来是更可靠的工程产品,而V4正式版更像界面还原较好、功能面较广但尚未收尾的原型。有科技博主评测,认为模型效果不及预期,或者是还未全量推送。实测水平低于灰测泄露水平。如果根据深夜个人实测,不认为V4 Pro正式版代表缩短海外Sota模型性能差距。 3)没有直接涨价。深夜发布以后,仍然按照原价。此前发了涨价预告,V4 Flash正式版调用量暴涨。V4 Pro正式版的涨价幅度预计和实际性能挂钩,即自身的模型帕累托。如果在Opus4.8+的水平,个人预期涨价空间可以达到折扣前的水平。预计上线后DeepSeek将观察调用情况,再给出涨价幅度。 4)原生Harness即将发布。Flash正式版本官方Benchmark评分基于轻量级原生Harness,非原生一般有效果折损。需要原生Harness开放后,继续评测Pro实际效果。近期DeepSeek Harness公众号已经注册。 5)按照更新时价格+评分,对国产模型是斩杀叙事。但是按照实际测试+涨价预期,保持斩杀叙事削弱的观点。方向:国产链(模型、算力、CPU)、CSP(算租、MaaS)、海外链。