MemHarness:AI Agent记忆重构新范式,7B模型超越Gemini-2.5-Pro
引言:当AI Agent学会“重构”记忆
在人工智能的演进中,记忆系统始终是智能体(Agent)实现长期学习和环境适应的核心组件。然而,传统的记忆增强Agent往往将检索到的历史经验直接注入当前上下文,这种做法在环境动态变化时极易引发“负迁移”——即旧经验不仅无助于当前决策,反而干扰了模型的判断。
上海AI实验室联合浙江大学、复旦大学、上海交通大学等顶尖高校,提出了MemHarness框架,这一创新性的记忆重构机制,借鉴了人类认知中的记忆重构过程,在检索与动作之间插入显式的批判与重构环节,让Agent能够根据当前状态对历史经验进行保留、改写或丢弃。这一设计不仅显著提升了任务成功率,更让7B参数的小模型在多个基准上超越了Gemini-2.5-Pro等超大模型,为AI Agent的记忆利用开辟了全新路径。
一、MemHarness的核心机制:从“回放”到“重构”
1.1 传统记忆增强的困境
在现有的记忆增强Agent中,通常采用“检索-注入”的静态范式:Agent根据当前观测从记忆库中检索相似经验,然后将其作为上下文的一部分直接输入给策略模型。这种方法的弊端在于,历史经验往往与当前状态存在差异,例如在具身智能任务中,房间布局、物体位置的变化可能使旧经验完全失效。直接回放这些过时信息,不仅无法提供有效指导,反而会干扰模型的推理,导致性能下降。
1.2 MemHarness的五阶段决策流程
MemHarness将记忆引导的决策过程分解为五个连续阶段:
- 环境观测:Agent接收当前环境的观测信息,包括任务描述、历史轨迹等。
- 经验检索:根据当前观测生成查询,从向量记忆库(基于Milvus)中召回top-k相关历史经验及其来源状态。
- 记忆批判:统一策略模型对比记忆来源状态与当前状态,批判其适用性,判断哪些部分可迁移、哪些需要改写、哪些应舍弃。
- 上下文记忆重构:基于批判结果,将经验改写为状态对齐的指导信息,或输出
<EMPTY>标记拒绝该记忆并回退到自主推理。 - 动作生成:基于重构后的指导信息或自主推理,生成可执行的环境动作。
这一流程模拟了人类“检索-评估-重构”的认知过程,取代了传统Agent直接回放记忆的静态范式,使记忆利用更加灵活和上下文敏感。
1.3 上下文记忆重构机制
MemHarness的核心创新在于“上下文记忆重构”。具体而言,策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接为重构上下文,通过对比历史来源状态与当前状态,识别差异并做出决策:
- 保留:如果经验中的知识在当前状态下仍然适用,则直接保留。
- 改写:如果经验部分适用但存在偏差,则进行改写,使其与当前状态对齐。
- 丢弃:如果经验完全不适用,则输出
<EMPTY>标记,拒绝该记忆,并依赖自主推理。
这种机制确保了记忆的利用是动态的、自适应的,而非机械的复制粘贴。
二、技术原理:统一策略模型与GRPO端到端训练
2.1 统一策略模型架构
MemHarness采用统一策略模型架构,检索查询生成、记忆批判重构与可执行动作生成三个阶段共享同一个策略模型参数。这种设计无需为重构模块单独训练价值网络或监督数据,使记忆利用与决策推理在同一模型内紧密耦合。这不仅简化了训练流程,还增强了模型在不同任务间的泛化能力。
2.2 GRPO端到端训练
由于重构指导信息没有真值标注,MemHarness采用GRPO(Group Relative Policy Optimization)对检索-重构-行动全链路进行端到端优化。奖励由稀疏任务结果与格式奖励组成,通过组归一化优势将轨迹级信用分配给所有token,同时训练思考、重构与动作生成能力。这种训练方式使得重构能力自然涌现,无需人工编写重构监督数据,大大降低了数据标注成本。
2.3 经验回写与剪枝
每轮交互后,MemHarness会将轨迹摘要为经验写入记忆库,并进行语义去重,避免冗余。同时,定期按经验效用剪枝低价值记忆,保持记忆库的高质量和时效性。这一机制确保了记忆库的持续优化,避免了无限增长带来的检索效率下降。
三、核心优势:数据说话
3.1 重构优于回放
MemHarness通过显式插入批判与重构环节,将静态记忆片段转化为上下文敏感的状态对齐指导,有效避免了负迁移。实验表明,在ALFWorld和WebShop任务上,MemHarness的成功率显著高于直接回放记忆的基线方法。
3.2 小模型超越大模型
令人惊讶的是,MemHarness仅使用7B参数规模的模型,就在ALFWorld和WebShop上分别超越Gemini-2.5-Pro 23.1%和39.7%。这一结果证明了记忆重构机制的有效性,即使模型容量有限,也能通过智能的记忆利用达到甚至超越超大模型的表现。
3.3 OOD鲁棒性强
在分布外(OOD)场景中,MemHarness的平均成功率达85.9%,显著高于原始记忆回放的76.3%。这表明MemHarness不仅能在训练分布内表现出色,还能在环境变化时保持稳定的性能,这对于真实世界应用至关重要。
3.4 隐式推理增强
即使测试时关闭记忆,MemHarness的重构训练目标仍使基础策略成功率从76.4%提升至83.0%。这说明重构训练不仅提升了记忆利用能力,还从根本上增强了Agent的内在推理能力,使其在没有外部记忆的情况下也能做出更好的决策。
3.5 无需额外标注
重构能力通过GRPO端到端训练自然涌现,不依赖人工编写的重构监督数据。这大大降低了应用门槛,使得MemHarness可以快速适配新任务。
四、如何使用MemHarness
4.1 环境准备
首先,克隆仓库并创建Python 3.12的Conda环境,安装vLLM、Flash Attention 2及MemHarness本体。具体命令如下:
git clone https://github.com/KnowledgeXLab/MemHarness.git
conda create -n memharness python=3.12
conda activate memharness
pip install vllm flash-attn
pip install -e .4.2 部署嵌入服务
MemHarness使用BGE-M3嵌入模型为Milvus记忆库提供向量编码服务。通过vLLM启动嵌入服务:
vllm serve BAAI/bge-m3 --port 80014.3 安装目标环境
根据任务需求,安装ALFWorld或WebShop交互环境,并下载对应的游戏文件与预训练检测器。具体步骤可参考项目文档。
4.4 冷启动SFT(可选)
运行scripts/build_*_coldstart_data.py构建冷启动数据,然后执行scripts/cold_start_sft.sh使模型对齐交互格式与记忆摘要格式。这一步有助于加速后续的GRPO训练。
4.5 GRPO端到端训练
运行run_scripts/train_alfworld.sh或run_scripts/train_webshop.sh,框架将自动启动记忆向量数据库、执行Agent检索、经验回写与剪枝,完成GRPO训练。训练完成后,模型即可用于推理。
五、与同类框架的对比
MemHarness与EvolveR等记忆增强框架相比,具有显著优势。EvolveR采用显式记忆库加经验演化机制,但检索后直接注入,依赖经验演化迭代,训练方式为RL,需要逐步积累经验。而MemHarness采用检索后批判重构,支持保留/改写/丢弃,训练方式为GRPO端到端,无需重构标注。在OOD表现上,MemHarness达到85.9%,而EvolveR未重点报告。此外,MemHarness的重构过程可检查,支持EMPTY拒绝,可解释性更强。在模型规模上,MemHarness仅需7B参数即可超越Gemini-2.5-Pro,而EvolveR通常需要更大规模或更多训练步数。
六、应用场景展望
6.1 具身智能家务
在ALFWorld等家庭环境中,MemHarness可重构过往取物、清洁经验,适配不同房间布局,完成复杂家务任务。例如,当房间布局变化时,Agent能够改写旧经验中的路径规划,而不是盲目遵循过时的路线。
6.2 自主在线购物
在WebShop等电商平台中,MemHarness根据历史购物经验重构为当前商品搜索与筛选策略,提升目标导向购物成功率。例如,当用户偏好变化时,Agent能够调整搜索关键词和筛选条件,而不是重复使用旧策略。
6.3 智能客服对话
客服Agent检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问。例如,当客户问题涉及新产品时,Agent能够改写旧方案中的产品信息,提供准确回答。
6.4 代码辅助开发
编程Agent重构过往bug修复经验,适配当前代码上下文,提供精准的修复建议而非照搬旧方案。例如,当代码库结构变化时,Agent能够调整修复步骤,避免引入新问题。
6.5 科研实验规划
实验Agent根据历史实验参数与结果重构为当前实验条件的最优配置建议,减少试错成本。例如,当实验材料批次变化时,Agent能够调整参数范围,提高实验成功率。
七、未来展望
MemHarness的出现标志着AI Agent记忆利用进入了一个新阶段。通过模拟人类记忆重构机制,它不仅解决了负迁移问题,还显著提升了模型的泛化能力和推理能力。未来,MemHarness有望在更多复杂任务中发挥作用,如自动驾驶、医疗诊断、金融决策等。同时,随着多模态记忆的引入,MemHarness有望进一步扩展其应用边界,实现更丰富的记忆表示和更智能的重构策略。
对于研究者和开发者而言,MemHarness提供了一个强大的开源工具,其代码和模型均已公开,便于复现和二次开发。我们期待看到更多基于MemHarness的创新应用,推动AI Agent向更智能、更自主的方向发展。