给 AI 装上记忆,它就真的记对了吗?HaluMem 拆解智能体记忆幻觉
⭐ **HaluMem** —— ⭐ **首个面向智能体记忆系统的操作级幻觉评测基准**(⭐ **EMNLP 2026 主会接收**)。⭐ **3 阶段拆分**:⭐ **记忆提取 / 记忆更新 / 记忆问答**,⭐ **不是只测最终答案**,⭐ **而是看错误在哪一步产生**。⭐ **6 套记忆系统实测**(⭐ Mem0 / Mem0-Graph / Memobase / MemOS / Supermemory / Zep)—— ⭐ **所有系统 Q&A 准确率都未达 70%**,⭐ **Mem0 从 Medium 53% 暴跌至 Long 28%**。
一句话总结
⭐ HaluMem —— ⭐ 首个面向智能体记忆系统的操作级幻觉评测基准(⭐ EMNLP 2026 主会接收)。⭐ 3 阶段拆分:⭐ 记忆提取 / 记忆更新 / 记忆问答,⭐ 不是只测最终答案,⭐ 而是看错误在哪一步产生。⭐ 6 套记忆系统实测(⭐ Mem0 / Mem0-Graph / Memobase / MemOS / Supermemory / Zep)—— ⭐ 所有系统 Q&A 准确率都未达 70%,⭐ Mem0 从 Medium 53% 暴跌至 Long 28%。⭐ 三大核心发现:(1) ⭐ 高召回率 ≠ 可靠(虚假记忆抵抗 FMR 拖累);(2) ⭐ 更新幻觉率 <1.2% 看似漂亮但 ⭐ 更新遗漏率高达 60-98%;(3) ⭐ 上游记忆问题最终传递到答案。
机构:⭐ 中国电信研究院 + 上海记忆张量(MemTensor)公司
一、核心问题 ⭐
“当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。但错误一定发生在回答的那一刻吗?”
⭐ 错误可能发生在三处:
- ⭐ 整理对话时记错了(提取阶段)
- ⭐ 保留旧记录没更新(更新阶段)
- ⭐ 拿到了正确记忆却答错(问答阶段)
“要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。”
二、HaluMem 三大评测维度 ⭐
| 维度 | 问题 |
|---|---|
| ⭐ 记忆提取 | 该记的信息是否被完整、准确地记录?有没有把虚构细节也写进去? |
| ⭐ 记忆更新 | 新信息出现后,旧记忆是否得到正确修改?有没有漏改 / 改错 / 留下冲突? |
| ⭐ 记忆问答 | 系统最终能否利用记忆给出正确回答?错误回答与因信息缺失而无法回答,各占多少? |
⭐ 关键:评测按对话时间顺序展开,在相关会话处理完成后立即触发 → 不仅看到总分,还看到不同操作阶段的具体问题。
三、数据构建 ⭐
⭐ 六阶段数据流程
⭐ 模拟 10-20 年用户经历:
- 用户画像
- 人生发展骨架
- 事件流
- 会话摘要
- 记忆点
- 多轮对话与评测问题
⭐ 3 类记忆:
- 画像(职业 / 健康 / 兴趣 / 人际关系)
- 事件
- 关系
⭐ 两个版本 ⭐
| 版本 | 用户 | 对话轮次 | Token / 用户 | 记忆点 | Q&A | 设计目标 |
|---|---|---|---|---|---|---|
| ⭐ Medium | ⭐ 20 位 | ⭐ 30,073 轮 | ⭐ ~16 万 | ⭐ 14,948 个 | ⭐ 3,467 个 | 基础测试 |
| ⭐ Long | 同上 | ⭐ 53,516 轮 | ⭐ 100 万+ | 同有效记忆 | 同上 | ⭐ 加干扰与上下文负担,看长上下文是否仍能保留有效信息 |
⭐ 6 类题型
- 基础事实回忆
- 多跳推理
- 动态更新
- 记忆边界
- 泛化与应用
- 记忆冲突
⭐ 人工校验:Medium 中 700 段会话人工评估,覆盖 >50% 会话,记忆点与问答正确率 95.70%。
四、6 套实测系统 ⭐
| 系统 | 类型 |
|---|---|
| ⭐ Mem0 | 通用型 |
| Mem0-Graph | 图结构增强 |
| Memobase | 通用型 |
| ⭐ MemOS | ⭐ 最佳表现 |
| Supermemory | 长上下文优 |
| Zep | 会话级 |
⭐ 统一测试条件:
- 更新任务:检索前 10 条相关记忆
- 问答任务:检索前 20 条记忆
- 答案生成:GPT-4o
五、三大核心发现 ⭐
发现 1:⭐ 召回率高 ≠ 记忆可靠
| 系统 | Medium 召回率 | Long 召回率 | Long FMR(虚假记忆抵抗) |
|---|---|---|---|
| Mem0 | 42.91% | 3.23% | — |
| Mem0-Graph | 43.28% | 2.24% | — |
| Memobase | 14.55% | 6.18% | — |
| ⭐ MemOS | — | ⭐ 81.90% | ⭐ 28.85% |
| ⭐ Supermemory | — | ⭐ 53.02% | ⭐ 36.86% |
⭐ 结论:⭐ MemOS / Supermemory 覆盖更多目标记忆,但虚假记忆抵抗低 —— 扩大信息覆盖并没有自动带来更强的真假辨别能力。
“可靠记忆需要同时做到两件事:该记的不能漏,不该信的不能存。单看召回率或记忆条数,都容易忽略另一侧的代价。”
发现 2:⭐ 更新幻觉率 <1.2% 看似漂亮,实际是悲剧
| 系统 | 更新幻觉率 | Long 遗漏率 | Long 正确更新率 |
|---|---|---|---|
| ⭐ Mem0 | <1.2% | ⭐ 98.51% | ⭐ 1.45% |
| Mem0-Graph | <1.2% | ⭐ 98.40% | ⭐ 1.47% |
| ⭐ MemOS | <1.2% | ~35% | ⭐ 65.25% ⭐最佳 |
“为什么「很少改错」会和「大量漏改」同时出现?”
⭐ 因为更新幻觉率衡量的是目标更新中发生错误更新的比例。当大量更新根本没有完成时,错误更新的比例也可能很低。⭐ 仅凭这一项数值,无法判断系统是否真正掌握了记忆更新。
发现 3:⭐ 上游记忆问题最终传递到答案
⭐ 所有受测系统 Q&A 正确率均未达 70%:
| 系统 | Medium Q&A | Long Q&A | Medium 遗漏率 | Long 遗漏率 |
|---|---|---|---|---|
| ⭐ MemOS ⭐最佳 | ⭐ 67.23% | ⭐ 64.44% | — | — |
| ⭐ Mem0 | 53.02% | ⭐ 28.11% | 27.81% | ⭐ 54.60% |
“Mem0 的问答正确率从 53.02% 降至 28.11%,同时问答遗漏率从 27.81% 升至 54.60%。这一变化与其上游记忆召回率的大幅下降相呼应。”
⭐ 题型能力差异:多数系统在 ⭐ 识别未知信息 / 错误前提 时表现相对较好,但面对 ⭐ 多跳推理 / 动态更新 / 泛化应用 仍存在明显短板。
六、对智能体工程的意义 ⭐
“HaluMem 带来的价值,是让记忆系统的改进方向变得更具体。”
| 问题层 | 检查项 |
|---|---|
| ⭐ 提取层 | 同时检查 ⭐ 信息覆盖 + ⭐ 来源可信度 |
| ⭐ 更新层 | 检查 ⭐ 新旧记忆关联 + 应做的修改是否真正完成 |
| ⭐ 问答层 | ⭐ 结合上游记录与检索结果继续分析 |
“这也解释了为什么一项漂亮的单独指标还不够:
- ⭐ 高召回可能伴随虚假信息写入
- ⭐ 低更新幻觉率可能伴随大量遗漏
- ⭐ 最终问答分数可能遮住内部不同环节的失败”
七、可复用评测思路 ⭐
“把最终答案背后的记忆操作逐一拿出来核对,让「哪里出了错」成为可以测量的问题。”
⭐ 未来扩展:
- 当前数据围绕模拟用户的画像 / 事件 / 关系记忆展开
- ⭐ 尚未全面覆盖工具 / 技能等其他记忆形态
- 不同系统开放的接口会影响内部操作的可观测程度
八、对 OpenClaw / Hermes Agent 的启示 ⭐
⭐ 3 点直接可借鉴:
| # | 启示 | 落地建议 |
|---|---|---|
| ⭐ 1 | 指标单一不可信 | 评测 memory 时同时看召回 / 遗漏 / FMR 3 项 |
| ⭐ 2 | 下游答案错 ≠ 当前问答错 | 加日志:每次输出 trace 回”取的是哪条记忆?” |
| 3 | ⭐ 构造 1M+ token 干扰场景 | Hermes Agent 的 skill marketplace 实战测试应包含长上下文干扰 |
来源
- 网易新闻(机器之心 Pro)· 原文
- HaluMem arXiv 论文
- GitHub 开源项目
- 论文:HaluMem: Evaluating Hallucinations in Memory Systems of Agents(EMNLP 2026 主会)