林 - 艾伦 AI 研究所 DataFunSummit # 2023 文本环境代理研究
研究背景
研究聚焦于在复杂交互式环境中(如 ALF 世界,包含 10 个地点、25 种动作类型、200+ 对象类型、多个状态及随机异常,共 30 种高级任务类型)的任务计划和执行。示例任务多为简单、短动作空间(如“将 A 放入 B”)。
研究方法
基线方法
- 强化学习(DRRN):作为深度强化学习相关网络的基础模型。
- KG-A2C:通过添加动态图约束动作和对象的选择。
- CALM:在计算 Q 函数后,使用更大的语言模型(GPT-2)对候选动作进行重新排序。
- 模仿学习(Transformer LM):采用行为克隆技术,通过语言模型模仿行为。
LLM 提示方法
在基线方法基础上,结合研究者提出的改进方法:
- 混合代理框架:结合较小的语言模型(LM)和带有两阶段提示的大型语言模型(LLM)。
- LLM 提示设计:采用 Plan(计划)和 Ground( grounding)两种提示样式,专为体现动作设计。
研究效率与成本效益
研究评估了方法的效率及成本效益,但具体数据未在摘要中详述。
研究结论
- SwiftSage 框架:是一个混合代理框架,结合了模仿学习的较小 LM 和带有两阶段提示的 LLM。
- 设计特点:专为体现动作设计,采用 Plan 和 Ground 样式的 LLM 提示。
- 局限性:
- 需要一个 oracle 代理进行离线学习。
- 仍然依赖封闭的 LLM。
- 需要一个互动的反馈环境(世界引擎)。
- 未来方向:
- 推广到更复杂的任务。
- 知识蒸馏。
- 真实世界的具体化机器人(带视觉输入)。
- 其他潜在研究方向。