登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
超越Chatgpt的AI agent综述
2025-02-17
-
哥伦比亚大学
光影
核心观点与关键数据
1. 模型自改进
背景
:LLMs 可通过提示进行自改进,但小型 LLM 在此过程中存在困难。
问题
:小型 LLM 无法通过提示学习“自改进”,且错误会传播。
方法
:TriPosT 通过 LLM/Python 脚本作为编辑模型,收集小型 LLM 与 LLM 的交互记录,进行交互式轨迹编辑。
数据后处理
:将交互数据格式化为 (尝试, 反馈, 更新) 三元组,并进行过滤和平衡。
模型训练
:使用加权 SFT,更侧重于反馈和更新标记,训练 LLaMA-1/LLaMA-2。
评估
:Big Bench Hard 任务上,TriPosT 提升了小型 LLM 的整体性能和自改进能力。
结论
:无需人类监督即可提升模型性能。
2. 基于树搜索增强模型能力
背景
:许多对话任务本质上是决策问题,可使用棋类游戏的 look-ahead 搜索增强。
方法
:使用 Prompt-Based Monte-Carlo Tree Search (MCTS) 进行对话策略规划。
评估
:在 PersuasionForGood 数据集上,GDP-Zero 生成的对话策略比基础 LLM 更具说服力。
结论
:树搜索是直接提升模型行为的有效方法。
3. AI 代理自改进
背景
:VLM 在计算机任务上表现困难,因为交互并非其预训练内容。
方法
:引入 R-MCTS,在推理时探索决策空间并自改进,并通过训练将搜索知识转移回 VLM。
R-MCTS
:包括 MCTS 与对比自反思,以及多代理辩论值函数。
评估
:在 VisualWebArena 和 OSWorld 上,R-MCTS 优于其他搜索算法,并达到 SOTA。
Exploratory Learning
:通过训练树遍历进行探索、评估和回溯。
结论
:GPT-4o 在 R-MCTS 树上进行探索性学习后,表现出计算扩展特性。
研究结论
TriPosT
:通过交互式轨迹编辑和训练,提升小型 LLM 的自改进能力。
树搜索
:有效提升对话任务的性能和策略质量。
R-MCTS 与 Exploratory Learning
:提升 AI 代理在复杂任务上的性能和泛化能力。
未来工作
使用强化学习方法减少对树搜索的依赖。
使用模型预测控制 (MPC) 方法减少昂贵的环境交互。
你可能感兴趣
超越ChatGPT的AI代理
哥伦比亚大学&Arklex AI
2025-08-24
超越ChatGPT:生成式AI的机遇、风险与挑战
信息技术
山东大学学报(哲学社会科学版)
2023-03-12
超越炒作:ChatGPT 和生成式 AI 的企业影响
信息技术
Gartner
2023-05-31
海外科技2025年投资策略:AI投资手册·ChatGPT发布两周年纪念版-AI Infra奏响主旋律,AI Agent拉开新画布
西南证券
2024-12-05
Agent应用的ChatGPT时刻20250306
未知机构
2025-03-06
国泰海通非银投研:投研Agent超越大模型的生产力
未知机构
2026-08-05
金融投研Agent行业深度报告:投研Agent,超越大模型的生产力
金融
国泰海通证券
2026-07-08
国泰海通非银投研:金融投研Agent超越大模型的生产力
未知机构
2026-08-05
1999年互联网行情复盘:ChatGPT的科技革命性有望超越1999年的互联网,复盘当年国内外行情可指引早
信息技术
国盛证券
2023-03-27
精通人工智能2025——超越ChatGPT的终极分步指南,提升生产力并使您的技能面向未来。
信息技术
DeepSeek
2025-03-16