MemHarness 是由上海人工智能实验室(Shanghai AI Lab)团队及其合作者提出的一种“LLM Agent 经验重构”框架。其核心目标是让 AI 智能体(Agent)的记忆机制像人类一样,不再是简单的“回放(Replay)”,而是能够结合当前上下文进行灵活的“重构(Reconstruction)”,从而更好地服务于当前的决策。

MemHarness核心特点
- 从“静态重放”到“动态重构”:打破了传统 AI 直接检索并生硬套用历史经验的模式,将记忆从静态的提示片段转变为具有上下文敏感性的动态指导信息。
- 显式的“批判与重构”环节:在传统的“检索”与“动作生成”之间,创新性地插入了对记忆进行评估、对齐和改写的步骤。
- 端到端自主优化:无需任何额外的人工标注,整个记忆重构流程主要依赖任务奖励,通过 GRPO(Group Relative Policy Optimization)算法进行端到端的强化学习优化。
- 高鲁棒性与泛化能力:不仅在常规任务中表现优异,在分布外(OOD)的陌生场景中也展现出很强的适应能力。
MemHarness技术原理
MemHarness 的工作流程主要分为三个核心阶段:
- 记忆检索(Memory Retrieval):模型根据最近几步的观测和动作,判断当前是否需要调用历史经验。如果需要,则查询经验记忆库获取相关记忆。
- 上下文记忆重构(Contextual Memory Reconstruction):这是框架的核心环节。模型会结合当前的任务描述、上下文、检索到的记忆以及来源状态,比较“过去”与“现在”的差异。在此基础上,模型主动决定是保留、改写还是丢弃该记忆,将其重构为当前可用的指导。如果没有合适的记忆,则跳过此步直接推理。
- 动作生成(Action Generation):模型结合当前的历史信息和重构后的指导,生成最终的执行动作。
在训练层面,MemHarness 采用 GRPO 算法,通过比较同一任务下多条轨迹的表现,让思考、重构和动作生成能力同时得到训练和优化,无需单独训练价值网络。
MemHarness核心优势
- 性能显著超越基线:在 ALFWorld 和 WebShop 等具有挑战性的 Agent 决策基准测试中,MemHarness 持续优于纯强化学习(RL)基线以及当前最优的静态记忆增强方法。
- 小模型战胜大模型:即便模型规模只有 7B(70亿参数),其表现也超越了更大规模的闭源模型(如 Gemini-2.5-Pro)。
- 减少负迁移并提升推理能力:自适应的重构机制有效避免了旧经验对新任务的干扰(负迁移),并且在重构记忆的过程中,进一步训练和强化了 Agent 自身的推理能力。
- 验证了重构的核心价值:消融实验证实,如果去除重构阶段,模型性能会退化到与朴素记忆重放相当的水平,这证明了“自适应重构”才是性能提升的真正驱动力。
MemHarness项目地址
- GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
- HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv技术论文:https://arxiv.org/pdf/2607.28272
MemHarness应用场景
MemHarness 主要应用于需要复杂决策和长程规划的 AI 智能体(Agent)场景:
- 具身智能与家庭任务:在 ALFWorld 等虚拟环境中,Agent 需要理解自然语言指令并完成如“寻找、清洁、加热物品”等一系列多步骤的交互任务。
- 网页导航与电商交互:在 WebShop 等模拟电商平台中,Agent 需要根据用户需求搜索商品、对比属性并完成购买决策,MemHarness 能帮助其利用历史经验应对复杂的网页交互。
- 陌生环境探索:得益于其强大的分布外(OOD)鲁棒性,MemHarness 适用于 Agent 面对未见过的环境或任务规则时,能够灵活调用并调整过往经验以完成探索。
MemHarness同类产品对比
| 开发主体 | 上海 AI Lab | MemGPT 开源社区 |
| 核心定位 | Agent 经验重构记忆框架,解决记忆负迁移问题 | 操作系统式分层虚拟内存 Agent 框架 |
| 核心机制 | 检索后增加记忆重构环节,结合 GRPO 强化学习适配当前任务,动态改写历史经验 | 核心内存 + 归档内存 + 召回内存,Agent 自主调度分页读取记忆 |
| 技术特色 | 侧重经验适配重构,降低旧经验对新任务的干扰,分布外场景鲁棒性强。 | 内存分层调度,模拟计算机虚拟内存,兼容各类大模型 |
| 适用场景 | Web、游戏交互智能体,分布外任务、需要复用历史经验的 Agent 研究项目。 | 长期会话 Agent、研究型智能体,对记忆调度可控性要求高的场景 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



