Claw AI Lab: 一个多层次多智能体研究平台
核心观点
Claw AI Lab 是一个实验室原生的多智能体研究平台,旨在通过将研究过程分解为五个结构化层级(想法、规划、编码、实验和写作)来自动化端到端的研究流程。该平台采用金字塔式架构,通过角色专业化、迭代优化和跨阶段反馈,模拟真实研究实践,并提供实时事件流、多项目监控、工件检查和一键回滚等功能,增强自主研究的实用性。
关键数据和研究结论
- 实验设置:Claw AI Lab 在四个不同主题上与 AutoResearchClaw 进行了比较,包括三个研究主题和一个复现主题。
- 评估指标:生成的论文由 ChatGPT 5.4 Thinking 和 Gemini 3.1 Pro 两个 LLM 评估员在六个维度上进行评估,包括技术深度和可复现性、结构和章节、写作质量、技术准确性、结果质量和整体质量。
- 实验结果:在三个研究主题上,Claw AI Lab 的平均得分提高了 15.5 到 16.5 分;在复现主题上,平均得分从 73.0/100 提高到 78.0/100,提升了 5.0 分。ChatGPT 和 Gemini 评估员在所有主题上都一致地给 Claw AI Lab 评了更高的分数,表明改进是稳定的。
- 多维度比较:在六个维度上,Claw AI Lab 表现出更强的竞争力,特别是在技术深度和可复现性、结果质量和整体质量方面。
平台架构
- 想法层:通过多智能体讨论阶段探索问题空间,鼓励多样化视角,并通过结构化辩论和共识机制选择最佳方向。
- 规划层:将选定的想法分解为结构化计划,包括任务、依赖关系和里程碑,并通过验证循环进行迭代优化。
- 编码层:将批准的实验计划转换为可运行的研究代码,通过 Claw-Code Harness 执行代码,并支持生成完整的科研交付物。
- 实验层:在计算资源上部署实验,收集指标和日志,并通过迭代优化循环进行分析和调整。
- 写作层:将实验结果转换为结构化科研输出,生成大纲、可视化、草稿和迭代审查,确保实验结果与报告一致。
贡献
Claw AI Lab 不仅提供了一个更强大的研究平台,还提出了一个更强大的研究框架,强调交互性、可检查性和可靠性,推动自主研究向更实用的方向发展。