MemHarness – 上海AI Lab团队及其合作者推出的智能体记忆重构框架

MemHarness 是由上海人工智能实验室(Shanghai AI Lab)团队及其合作者提出的一种“LLM Agent 经验重构”框架。其核心目标是让 AI 智能体(Agent)的记忆机制像人类一样,不再是简单的“回放(Replay)”,而是能够结合当前上下文进行灵活的“重构(Reconstruction)”,从而更好地服务于当前的决策。

MemHarness - 上海AI Lab团队及其合作者推出的智能体记忆重构框架

MemHarness核心特点

  1. 从“静态重放”到“动态重构”:打破了传统 AI 直接检索并生硬套用历史经验的模式,将记忆从静态的提示片段转变为具有上下文敏感性的动态指导信息。
  2. 显式的“批判与重构”环节:在传统的“检索”与“动作生成”之间,创新性地插入了对记忆进行评估、对齐和改写的步骤。
  3. 端到端自主优化:无需任何额外的人工标注,整个记忆重构流程主要依赖任务奖励,通过 GRPO(Group Relative Policy Optimization)算法进行端到端的强化学习优化。
  4. 高鲁棒性与泛化能力:不仅在常规任务中表现优异,在分布外(OOD)的陌生场景中也展现出很强的适应能力。

MemHarness技术原理

MemHarness 的工作流程主要分为三个核心阶段:
  1. 记忆检索(Memory Retrieval):模型根据最近几步的观测和动作,判断当前是否需要调用历史经验。如果需要,则查询经验记忆库获取相关记忆。
  2. 上下文记忆重构(Contextual Memory Reconstruction):这是框架的核心环节。模型会结合当前的任务描述、上下文、检索到的记忆以及来源状态,比较“过去”与“现在”的差异。在此基础上,模型主动决定是保留、改写还是丢弃该记忆,将其重构为当前可用的指导。如果没有合适的记忆,则跳过此步直接推理。
  3. 动作生成(Action Generation):模型结合当前的历史信息和重构后的指导,生成最终的执行动作。
    在训练层面,MemHarness 采用 GRPO 算法,通过比较同一任务下多条轨迹的表现,让思考、重构和动作生成能力同时得到训练和优化,无需单独训练价值网络。

MemHarness核心优势

  1. 性能显著超越基线:在 ALFWorld 和 WebShop 等具有挑战性的 Agent 决策基准测试中,MemHarness 持续优于纯强化学习(RL)基线以及当前最优的静态记忆增强方法。
  2. 小模型战胜大模型:即便模型规模只有 7B(70亿参数),其表现也超越了更大规模的闭源模型(如 Gemini-2.5-Pro)。
  3. 减少负迁移并提升推理能力:自适应的重构机制有效避免了旧经验对新任务的干扰(负迁移),并且在重构记忆的过程中,进一步训练和强化了 Agent 自身的推理能力。
  4. 验证了重构的核心价值:消融实验证实,如果去除重构阶段,模型性能会退化到与朴素记忆重放相当的水平,这证明了“自适应重构”才是性能提升的真正驱动力。

MemHarness项目地址

  • GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
  • HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
  • arXiv技术论文:https://arxiv.org/pdf/2607.28272

MemHarness应用场景

MemHarness 主要应用于需要复杂决策和长程规划的 AI 智能体(Agent)场景
  1. 具身智能与家庭任务:在 ALFWorld 等虚拟环境中,Agent 需要理解自然语言指令并完成如“寻找、清洁、加热物品”等一系列多步骤的交互任务。
  2. 网页导航与电商交互:在 WebShop 等模拟电商平台中,Agent 需要根据用户需求搜索商品、对比属性并完成购买决策,MemHarness 能帮助其利用历史经验应对复杂的网页交互。
  3. 陌生环境探索:得益于其强大的分布外(OOD)鲁棒性,MemHarness 适用于 Agent 面对未见过的环境或任务规则时,能够灵活调用并调整过往经验以完成探索。

MemHarness同类产品对比

开发主体上海 AI LabMemGPT 开源社区
核心定位Agent 经验重构记忆框架,解决记忆负迁移问题操作系统式分层虚拟内存 Agent 框架
核心机制检索后增加记忆重构环节,结合 GRPO 强化学习适配当前任务,动态改写历史经验核心内存 + 归档内存 + 召回内存,Agent 自主调度分页读取记忆
技术特色侧重经验适配重构,降低旧经验对新任务的干扰,分布外场景鲁棒性强。内存分层调度,模拟计算机虚拟内存,兼容各类大模型
适用场景Web、游戏交互智能体,分布外任务、需要复用历史经验的 Agent 研究项目。长期会话 Agent、研究型智能体,对记忆调度可控性要求高的场景
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...