实测约1.2亿token,前端类项目存在多轮修改不通情况,投研类项目勾稽关系难找,GPT5.6Sol可一次过。复杂后端项目V4 Pro正式版核心Agent循环能运行,但存在假流式、工具串行问题。实际效果预计在Opus4.6+(小样本)水平。GPT5.6Sol+UltraCode更可靠,V4正式版更像未收尾的原型。科技博主评测认为模型效果不及预期或未全量推送,实测水平低于灰测泄露水平,不认为V4 Pro正式版代表缩短海外Sota模型性能差距。
按更新时价格+评分,国产模型对国产链(模型、算力、CPU)、CSP(算租、MaaS)、海外链是斩杀叙事。需原生Harness开放后继续评测Pro实际效果。DeepSeek Harness公众号已注册。
实测约1.2亿token,前端类项目存在多轮修改不通情况,投研类项目勾稽关系难找,GPT5.6Sol可一次过。复杂后端项目V4 Pro正式版核心Agent循环能运行,但存在假流式、工具串行问题。实际效果预计在Opus4.6+(小样本)水平。GPT5.6Sol+UltraCode更可靠,V4正式版更像未收尾的原型。科技博主评测认为模型效果不及预期或未全量推送,实测水平低于灰测泄露水平,不认为V4 Pro正式版代表缩短海外Sota模型性能差距。
未直接涨价,深夜发布后仍按原价。此前V4 Flash正式版调用量暴涨。V4 Pro正式版涨价幅度预计与性能挂钩(自身模型帕累托),若达Opus4.8+水平,涨价空间可达折扣前水平。预计DeepSeek上线后观察调用情况再定涨价幅度。
原生Harness即将发布,官方Benchmark评分基于轻量级原生Harness,非原生效果折损。需原生Harness开放后继续评测Pro实际效果。DeepSeek Harness公众号已注册。