核心观点
该研报提出了 MEMOPILOT,一个通过端到端强化学习训练的动态经验记忆模型,旨在提升大型语言模型(LLM)在重复交互环境中的测试时学习能力(TTL)。现有方法通常依赖手工设计的提示规则来更新显式记忆,难以在多步视野内与下游目标保持一致。MEMOPILOT 通过将记忆更新视为一个可训练的多回合决策问题,并使用多回合 GRPO 进行优化,直接优化记忆更新过程,从而提升冻结 LLM 在连续交互中的性能。
方法
MEMOPILOT 将记忆更新建模为一个多回合决策问题,并使用多回合 GRPO 进行端到端优化。为了实现更稳定的信用分配,训练过程引入了回合奖励信号和回合级别的优势估计。记忆模型被结构化为三个组件:推理层、知识库和最终策略提示,以实现迭代更新过程。
实验
MEMOPILOT 在多轮 Rock-Paper-Scissors (RPS) 和 Limit Texas Hold’em (LHE) 两个测试环境中进行了评估。结果表明,MEMOPILOT 在两个游戏中均显著优于强基线,在 Elo 评分中排名第一(LHE 为 1762,RPS 为 1590),并超越了所有基线记忆方法和专有模型,包括 DeepSeek-V3.2。
结论
MEMOPILOT 通过将记忆更新视为可训练的决策过程,并通过多回合 GRPO 进行优化,显著提升了冻结 LLM 在重复交互环境中的测试时学习能力。该方法在 RPS 和 LHE 两个游戏中均取得了优异的性能,并展现出强大的泛化能力,能够适应未见过的对手和更大的玩家模型。