您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:多智能体Multi-Agent长程任务时代Scalin - 发现报告

多智能体Multi-Agent长程任务时代Scalin

2026-07-21 未知机构 洪雁
报告封面

[玫瑰]本篇深度旨在解答市场对AI投入持续性放缓的疑虑。我们认为Multi-Agent及长程任务,推高了单Token的推理成本,也使得通信开销非线性扩张,有望开启新一轮Scaling Law,打开AI产业链新一轮的高度。 [红包]长程任务是新一代SoTA模型的竞争焦点,也是本轮AI能否解锁更大价值量的关键一跃。 长程任务要求Agent将宏大目标自主拆解为多个子任务,持续运行数小时至数天,依赖1M以上的无损上下文作为记忆基础设施。长程任务能力的突破直接支撑Multi-Agent、模型自治(无人公司)、AI4S等新场景的落地,决定着AI从“辅助工具”向“生产力主体”的质变能否真正实现。2026年7月,智谱发布GLM-5.2,以长程任务为核心设计目标,标志着国产模型跻身全球第一梯队。 [红包]Multi-Agent是长程任务落地的重要架构形态,有望开启新一轮Scaling Law。 单Agent处理长程任务时面临context rot问题;Multi-Agent通过编排器(Orchestrator)将复杂任务动态拆解,分配至多个subAgent并行执行,实现并行协作。Multi-Agent有望解绑以个人助理为代表的单Agent应用范式,开启新一轮Scaling Law: Claude Code等产品已验证单Agent的商业化闭环,但以OS World 2.0为代表的长时间(小时级)任务,GPT5.5和Claude Opus 4.7的成功率仍在25%以下。而基于Multi-Agent架构,Claude能够并行探索多个研究方向,内部评测中表现超越单Agent 90.2%;此外,Vending-Bench 2的进展,和Hertz Connected Fleet OS的落地,都标志着长程Multi-Agent从“完成任务”走向“运行系统”。 [红包]Agent = Model + Harness,Harness是Multi-Agent时代大模型的操作系统与数据底座。 Multi-Agent时代Harness的价值被进一步放大,助力Multi-Agent迈向系统级交付。《Harness Engineering: A Survey》基准测试显示,更换Harness带来的性能提升约为更换模型的22倍;同一Fable 5模型在Cursor与Claude Code两个Harness下功能通过率相差12.8个百分点,证明Agent产品的性能差异已从模型本体转向Harness工程。 [红包]国产模型、云及CPU、AI应用有望受益: (1)AI Infra(CPU、服务器与云):Multi-Agent拓展Token增量空间,驱动CPU、服务器与云需求的继续扩张,建议关注海光信息、浪潮信息、深信服、金山云等; (2)国产模型:Multi-Agent丰富了模型的评判标准,国产模型的综合能力有望继续提 升,中长期RSI(Recursive Self-lmprovement)会成为模型追求的方向,建议关注智谱及其他国产模型; (3)AI应用:Multi-Agent将AI从“辅助工具”升级为“数字员工”,有望落地更多商业化场景,建议关注晶泰控股、英矽智能、金山办公、金蝶国际等。 ========================#文字观点