杂谈

给 AI 装上记忆,它就真的记对了吗?HaluMem 拆解智能体记忆幻觉

⭐ **HaluMem** —— ⭐ **首个面向智能体记忆系统的操作级幻觉评测基准**(⭐ **EMNLP 2026 主会接收**)。⭐ **3 阶段拆分**:⭐ **记忆提取 / 记忆更新 / 记忆问答**,⭐ **不是只测最终答案**,⭐ **而是看错误在哪一步产生**。⭐ **6 套记忆系统实测**(⭐ Mem0 / Mem0-Graph / Memobase / MemOS / Supermemory / Zep)—— ⭐ **所有系统 Q&A 准确率都未达 70%**,⭐ **Mem0 从 Medium 53% 暴跌至 Long 28%**。

一句话总结

⭐ HaluMem —— ⭐ 首个面向智能体记忆系统的操作级幻觉评测基准(⭐ EMNLP 2026 主会接收)。⭐ 3 阶段拆分:⭐ 记忆提取 / 记忆更新 / 记忆问答,⭐ 不是只测最终答案,⭐ 而是看错误在哪一步产生。⭐ 6 套记忆系统实测(⭐ Mem0 / Mem0-Graph / Memobase / MemOS / Supermemory / Zep)—— ⭐ 所有系统 Q&A 准确率都未达 70%,⭐ Mem0 从 Medium 53% 暴跌至 Long 28%。⭐ 三大核心发现:(1) ⭐ 高召回率 ≠ 可靠(虚假记忆抵抗 FMR 拖累);(2) ⭐ 更新幻觉率 <1.2% 看似漂亮但 ⭐ 更新遗漏率高达 60-98%;(3) ⭐ 上游记忆问题最终传递到答案。

机构:⭐ 中国电信研究院 + 上海记忆张量(MemTensor)公司


一、核心问题 ⭐

“当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。但错误一定发生在回答的那一刻吗?”

⭐ 错误可能发生在三处:

  • ⭐ 整理对话时记错了(提取阶段)
  • ⭐ 保留旧记录没更新(更新阶段)
  • ⭐ 拿到了正确记忆却答错(问答阶段)

“要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。”


二、HaluMem 三大评测维度 ⭐

维度问题
⭐ 记忆提取该记的信息是否被完整、准确地记录?有没有把虚构细节也写进去?
⭐ 记忆更新新信息出现后,旧记忆是否得到正确修改?有没有漏改 / 改错 / 留下冲突?
⭐ 记忆问答系统最终能否利用记忆给出正确回答?错误回答与因信息缺失而无法回答,各占多少?

⭐ 关键:评测按对话时间顺序展开,在相关会话处理完成后立即触发 → 不仅看到总分,还看到不同操作阶段的具体问题。


三、数据构建 ⭐

⭐ 六阶段数据流程

⭐ 模拟 10-20 年用户经历:

  1. 用户画像
  2. 人生发展骨架
  3. 事件流
  4. 会话摘要
  5. 记忆点
  6. 多轮对话与评测问题

⭐ 3 类记忆:

  • 画像(职业 / 健康 / 兴趣 / 人际关系)
  • 事件
  • 关系

⭐ 两个版本 ⭐

版本用户对话轮次Token / 用户记忆点Q&A设计目标
⭐ Medium⭐ 20 位⭐ 30,073 轮⭐ ~16 万⭐ 14,948 个⭐ 3,467 个基础测试
⭐ Long同上⭐ 53,516 轮⭐ 100 万+同有效记忆同上⭐ 加干扰与上下文负担,看长上下文是否仍能保留有效信息

⭐ 6 类题型

  1. 基础事实回忆
  2. 多跳推理
  3. 动态更新
  4. 记忆边界
  5. 泛化与应用
  6. 记忆冲突

⭐ 人工校验:Medium 中 700 段会话人工评估,覆盖 >50% 会话,记忆点与问答正确率 95.70%。


四、6 套实测系统 ⭐

系统类型
⭐ Mem0通用型
Mem0-Graph图结构增强
Memobase通用型
⭐ MemOS⭐ 最佳表现
Supermemory长上下文优
Zep会话级

⭐ 统一测试条件:

  • 更新任务:检索前 10 条相关记忆
  • 问答任务:检索前 20 条记忆
  • 答案生成:GPT-4o

五、三大核心发现 ⭐

发现 1:⭐ 召回率高 ≠ 记忆可靠

系统Medium 召回率Long 召回率Long FMR(虚假记忆抵抗)
Mem042.91%3.23%—
Mem0-Graph43.28%2.24%—
Memobase14.55%6.18%—
⭐ MemOS—⭐ 81.90%⭐ 28.85%
⭐ Supermemory—⭐ 53.02%⭐ 36.86%

⭐ 结论:⭐ MemOS / Supermemory 覆盖更多目标记忆,但虚假记忆抵抗低 —— 扩大信息覆盖并没有自动带来更强的真假辨别能力。

“可靠记忆需要同时做到两件事:该记的不能漏,不该信的不能存。单看召回率或记忆条数,都容易忽略另一侧的代价。”

发现 2:⭐ 更新幻觉率 <1.2% 看似漂亮,实际是悲剧

系统更新幻觉率Long 遗漏率Long 正确更新率
⭐ Mem0<1.2%⭐ 98.51%⭐ 1.45%
Mem0-Graph<1.2%⭐ 98.40%⭐ 1.47%
⭐ MemOS<1.2%~35%⭐ 65.25% ⭐最佳

“为什么「很少改错」会和「大量漏改」同时出现?”

⭐ 因为更新幻觉率衡量的是目标更新中发生错误更新的比例。当大量更新根本没有完成时,错误更新的比例也可能很低。⭐ 仅凭这一项数值,无法判断系统是否真正掌握了记忆更新。

发现 3:⭐ 上游记忆问题最终传递到答案

⭐ 所有受测系统 Q&A 正确率均未达 70%:

系统Medium Q&ALong Q&AMedium 遗漏率Long 遗漏率
⭐ MemOS ⭐最佳⭐ 67.23%⭐ 64.44%——
⭐ Mem053.02%⭐ 28.11%27.81%⭐ 54.60%

“Mem0 的问答正确率从 53.02% 降至 28.11%,同时问答遗漏率从 27.81% 升至 54.60%。这一变化与其上游记忆召回率的大幅下降相呼应。”

⭐ 题型能力差异:多数系统在 ⭐ 识别未知信息 / 错误前提 时表现相对较好,但面对 ⭐ 多跳推理 / 动态更新 / 泛化应用 仍存在明显短板。


六、对智能体工程的意义 ⭐

“HaluMem 带来的价值,是让记忆系统的改进方向变得更具体。”

问题层检查项
⭐ 提取层同时检查 ⭐ 信息覆盖 + ⭐ 来源可信度
⭐ 更新层检查 ⭐ 新旧记忆关联 + 应做的修改是否真正完成
⭐ 问答层⭐ 结合上游记录与检索结果继续分析

“这也解释了为什么一项漂亮的单独指标还不够:

  • ⭐ 高召回可能伴随虚假信息写入
  • ⭐ 低更新幻觉率可能伴随大量遗漏
  • ⭐ 最终问答分数可能遮住内部不同环节的失败”

七、可复用评测思路 ⭐

“把最终答案背后的记忆操作逐一拿出来核对,让「哪里出了错」成为可以测量的问题。”

⭐ 未来扩展:

  • 当前数据围绕模拟用户的画像 / 事件 / 关系记忆展开
  • ⭐ 尚未全面覆盖工具 / 技能等其他记忆形态
  • 不同系统开放的接口会影响内部操作的可观测程度

八、对 OpenClaw / Hermes Agent 的启示 ⭐

⭐ 3 点直接可借鉴:

#启示落地建议
⭐ 1指标单一不可信评测 memory 时同时看召回 / 遗漏 / FMR 3 项
⭐ 2下游答案错 ≠ 当前问答错加日志:每次输出 trace 回”取的是哪条记忆?”
3⭐ 构造 1M+ token 干扰场景Hermes Agent 的 skill marketplace 实战测试应包含长上下文干扰

来源