该报告核心分析了DeepSeek-V4-Flash多模态版本在性能表现、价格、多模态识别、生成类任务及长线程任务上的测试结果。报告指出其多模态任务表现与Kimi K3接近,对标GPT-4.8,但落后于豆包、Phi-5等前沿模型。在图片输入成本上,单token费用约0.0000001元,2亿token仅需30元。多模态识别测试显示其因AI治理规则误识别人物,生成任务存在图片衔接生硬、物理规则bug等问题,但相比非多模态版本有提升。报告还探讨了DeepSeek的发展策略,认为多模态是AI组件而非主线,未来将聚焦语言模型、思维链、Agent等核心能力。
AI多模态赛道正快速发展,但目前多模态仍是AI的组件而非独立主线。从测评看,DeepSeek-V4-Flash多模态版在多模态任务上表现与Kimi K3接近,但存在生成任务中的图片衔接生硬、物理规则bug等问题,显示多模态技术仍需完善。市场方面,DeepSeek-V4-Flash发布拉低了大模型性价比,推动了AI产业发展。未来,多模态技术将更侧重与其他AI能力的融合,如语言模型、思维链、Agent等,以推进AGI路线发展。行业需关注多模态技术的实用性与成本效益,以及企业如何平衡多模态与其他核心能力的投入。
报告重点分析了DeepSeek-V4-Flash多模态版本在多模态任务上的性能表现,包括图片输入成本、多模态识别准确率、生成类任务耗时与质量,以及长线程任务下的画面表现与物理规则。测试显示其多模态识别因AI治理规则存在误识别问题,生成任务耗时较长且存在细节缺陷,如图片衔接生硬、物理规则bug等,但相比非多模态版本有提升。此外,报告还分析了DeepSeek的发展策略,认为其未来将聚焦语言模型、思维链、Agent等核心能力,而非过度侧重视觉等动态能力。
当前大模型市场呈现多模态技术快速迭代但尚未成熟的现状。测评显示,DeepSeek-V4-Flash多模态版在性能上与Kimi K3接近,但落后于豆包、Phi-5等前沿模型,表明多模态技术仍需突破。市场方面,DeepSeek-V4-Flash发布拉低了大模型性价比,推动了AI产业发展,后续将持续关注Kimi 3.1、Grme等新模型的测试。大模型市场正从单一能力竞赛转向多能力融合,企业需平衡多模态与其他核心能力的投入,以实现更广泛的AI应用落地。
研报提示的风险主要集中在多模态技术的成熟度与实用性上。测评显示,DeepSeek-V4-Flash多模态版在生成任务中存在图片衔接生硬、物理规则bug等问题,表明多模态技术仍需完善。此外,DeepSeek的发展策略显示其未来将聚焦语言模型、思维链、Agent等核心能力,而非过度侧重视觉等动态能力,可能存在技术路线调整风险。市场方面,多模态技术的成本效益仍需验证,企业需关注技术投入与产出平衡。行业需关注多模态技术在实际应用中的表现,以及企业如何应对技术路线调整带来的不确定性。