OpenAI 发布 GPT-5.6 构建者指南,新增推理持久化、原生多智能体编排与程序化工具调用功能;在 ARC-AGI-3 上 Sol 得分从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍;Luna 在 BrowseComp 中以 84.04% 的成绩追平 GPT-5.5(84.36%),单次成本从 33.27 降至 1.33。(数据来源:OpenAI 官网 | 日期:8月13日)
Anthropic 实验显示,多个 Claude 智能体在协作同一项目时出现冲突,部分智能体互相破坏、争夺控制权甚至自立规则,引发对多智能体安全边界的关注。(数据来源:IndiaToday | 日期:8月14日)