Agent记忆高分幻象破灭!LoCoMo-Refined严苛标尺下主流框架得分暴跌22%,南京大学与上海AI实验室联合发布
导语:主流Agent记忆框架在旧评测中常获90%以上高分,但实际表现差强人意。南京大学与上海AI实验室联合推出LoCoMo-Refined基准,用更严苛的裁判与净化后的数据重新测试,揭示出此前被隐瞒的真实短板。
如果一台智能助手能和你聊一整天,却在你第二天问“我昨天说把那份文件放哪儿了”时胡编乱造,这样的体验足以毁掉所有信任。这正是当下Agent记忆系统面临的尴尬:在业界流行的记忆评测基准上,Mem0、MemOS等框架动辄拿到90%以上的高分,被捧为“记忆专家”,可一旦接入真实业务,忘记日程、混淆偏好、甚至无中生有地补全对话细节——这类翻车事故仍层出不穷。
为什么评测与现实之间存在如此巨大的鸿沟?南京大学强化学习实验室与上海人工智能实验室群体智能团队给出了一针见血的诊断:不是记忆框架变差了,而是评测的“尺子”本身就是坏的。他们在深度剖析超长对话记忆基准LoCoMo之后,揪出了两大系统性漏洞——评判标准过于宽容,以及考题本身存在错漏,并据此打造了一套专为检验记忆架构真实能力而生的严格基准LoCoMo-Refined。在这把新“尺子”下,此前风光无限的主流记忆框架得分普遍暴跌15~22个百分点,隐藏在旧基准高分背后的真实短板终于被逼出水面。本文为你完整拆解这场记忆评测的大洗牌:旧基准为什么失灵?新基准如何破局?以及这场反思将如何重塑Agent记忆赛道的竞争格局。

一场高分泡沫:Agent记忆的“期中考试”与真实世界的脱节
先看背景。随着大模型被嵌入到越来越多的智能体(Agent)中,记忆能力已从锦上添花升级为核心基础设施。无论是你的私人助理记住全家人的饮食禁忌,还是企业客服记住客户半年前的投诉细节,都要求Agent在长达数周、数月的交互中准确提取并应用个性化信息。虽然模型的上下文窗口已从128K暴增至1M甚至2M token,但精明的从业者很快发现,单纯靠“长上下文”解决不了长周期记忆的深度难题——模型仍会在冗长的对话历史中“失忆”,并产生幻觉。
于是,外挂记忆框架(如Mem0、MemGPT、MemOS等)成为业界寄予厚望的解法。这些框架通过向量检索、知识图谱或结构化存储,试图为Agent搭建一个稳固的长期记忆底座。评测这些框架的行业基准也随之诞生,其中最知名的当属LoCoMo(Long Context Memory Benchmark)。在LoCoMo的榜单上,主流记忆框架的得分普遍在90%以上,给人一种技术已接近成熟的错觉。
然而,南京大学与上海AI实验室的联合团队在将同一批框架接入真实对话测试时,却观察到了截然不同的画面:Agent频繁答错昨日约定、搞混人物、编造对话中从未出现的细节。这种反差促使他们对评测基准本身进行了审讯式的剖析,并得出了一个令人警醒的结论——不是选手不行,是裁判和考卷出了问题。
旧基准为何纵容“漏勺记忆”?两大根本性漏洞浮出水面
在高分幻象的背后,究竟藏着怎样的猫腻?联合团队把目标锁定在考官(Judger)和考题(数据集)这两个基本要素上,并总结出两大核心漏洞。
漏洞一:裁判“心太大”——以“相关即正确”掩盖三大缺陷
现有评测体系中,通常采用一个通用LLM作为裁判,判断Agent的回答是否与标准答案“语义相关”。这种“相关即正确”的思路看似合理,实则极度宽容,在三个层面纵容了无效记忆:
- 时间漂移(Temporal Drift):问题为“Deborah 何时去巴西”,标准答案是“2020年”。如果记忆系统回答“2020年8月30日”,多出了一个未经确认的具体日期,通用裁判仍会点头通过——因为它判定“2020年”这个关键信息已出现。可对于严肃的记忆应用而言,擅自添加精确日期本身就是一种幻觉,极可能在实际场景中引发错误指令。
- 过度生成(Over-generation)与冗余:问“他喜欢什么类型的电影”,标准答案是“动作片和科幻片”,但记忆系统却输出“动作、科幻和奇幻片”。在旧规则下,只要包含了标准答案中的类型,哪怕多召回了一个无关项,满分依旧。这导致记忆框架即使召回了一大堆无用信息,也能轻松拿到高分,掩盖了检索策略的根本缺陷。
- 信息不完整被忽略:更加致命的是,旧裁判对回答的完整性缺乏强制约束。如果一个答案只命中了标准答案中的部分要素,例如关于一场会议的时间、地点、参与人,只回答了时间和地点而漏掉了参与者,只要剩余部分仍与问题“相关”,仍可能被判定为正确。这使得那些关键信息大量遗漏的记忆系统同样能够蒙混过关。
这种宽松的评判标准导致评测的假阳性率飙升。联合团队的实验显示,旧裁判(使用GPT-4o mini为后端)在人工精标注的高难题目上准确率仅为43.67%——意味着超过一半的评分都是错误的。这无异于用一把刻度模糊的尺子去丈量精密零件,得出的“合格率”毫无意义。
漏洞二:考题本身“带病上岗”——337道存在逻辑与事实硬伤的题目
评测标准不可靠,考题质量同样堪忧。团队通过“前沿AI初筛 + 人工逐题核验”的混合流水线,在原始LoCoMo数据集中锁定出337道存在逻辑或事实偏差的题目。这些题目若能作为“标准答案”,就会直接让评测错上加错。

最典型的错误是主客体颠倒。例如原题:“Nate 去 Joanna 家玩时想做什么?”但回溯长达数百轮的原始对话记录,Nate 真正说的是:“我很高兴你能再来我家玩”——访客和主人的身份被完全写反了。在这种情况下,如果记忆系统忠实地复述了对话中的正确答案,反而会被判定为错误,因为它不符合“有病”的标准答案。类似的问题还包括时间线错乱、事件张冠李戴、问题表述模糊等。这些“脏数据”无形中扭曲了评测结果,让一些错误答案被错误地认可,也让正确答案蒙冤。
正是这两大漏洞,让旧基准逐渐演变为一场“自嗨”的游戏——得分越来越高,而实际能力却在原地踏步。
LoCoMo-Refined:一套专为记忆架构打造的严苛“体检仪”
面对旧基准的系统性缺陷,联合团队没有选择小修小补,而是从零重新定义了记忆评测的标准与流程,推出了LoCoMo-Refined——一个以“精确、完整、无幻觉”为生命线的全新基准。
新Judger设计哲学:“包含且不矛盾,完整且不越界”
新裁判的核心原则只有八个字:包含且不矛盾,完整且不越界。它将记忆评测从“语义相关性”的游戏拉回到“信息保真度”的本质。
- 必要信息完整覆盖:回答必须覆盖标准答案中的所有关键要素。哪怕只漏掉一个要素,该题即判错。评测关注的不再是“答对了多少”,而是“有没有答全”。
- 冗余生成边界控制:回答不能超出标准答案的可验证范围。任何未经证实的额外细节,即便看起来合理,也会被扣分。评测追求的是“忠实复现”,而不是“合理扩展”。例如时间漂移、多余类型都会被精准抓到。
- 矛盾检测:如果回答中出现与标准答案直接矛盾的信息,直接判错。这杜绝了那种表面上沾边、实则胡说八道的答案。
用一句话概括,新裁判问的不再是“这个答案和标准答案像不像”,而是“如果这是一份法庭证词,它是否100%符合事实记录”。这种严苛的标准才能逼出记忆系统的真正弱点。
数据净化与多模态标记:用“干净数据”绘制能力图谱
有了精准的裁判后,联合团队紧接着对考卷进行了大规模净化。在剔除部分无效题型后,他们针对余下的1540道核心考题,逐一复核了AI初筛出的问题题目,最终精修了337道存在逻辑或事实硬伤的题目,获得1382道高质量精修题目。这一过程涉及对对话历史的反复回溯,确保每道题的标准答案都与原始对话记录严丝合缝。
值得一提的是,团队还前瞻性地加入了多模态标记。针对1382道题目中的521道(占比37.70%),他们明确标注了该题“是否涉及图片理解”。这一标记旨在剥离一个长期被忽略的归因盲区:当Agent在图文交错的长期对话中答错时,究竟是因为文本记忆没存好,还是因为根本没看懂图片?多模态标记让开发者可以区分“纯文本记忆”与“多模态记忆”的能力边界,实现更精细的调试。
严苛标尺下的重测:主流记忆框架真实成绩单曝光

标尺和考卷都准备好了,是时候让选手们重新登场了。联合团队邀请当前主流的记忆框架——包括Mem0、MemOS、EverMemOS与MemPalace——在LoCoMo-Refined的统一下接受检阅,并与旧基准下的成绩进行了对比。
裁判本身的较量:从43%到86%的准确率飞跃
在评测记忆框架之前,先确保新裁判本身是可靠的。团队构建了一个包含300道高难度题目的双盲测试集,人工标注者对其中的一致性高达0.9373,且有92.33%的样本一致性超过0.8。这说明人类对“记忆是否准确”有着高度共识。
以此为基准,旧裁判(GPT-4o mini + 旧评判规则)的准确率仅为43.67%。而将后端LLM更换为Qwen3-14B并搭配新评判规则后,准确率飙升至86.33%。更细致地看,在人工标注一致性大于0.8的高共识样本上,新裁判准确率进一步达到89.5%,而旧裁判的两类样本准确率几乎持平于48%左右,说明旧裁判的评分几乎与题目难度无关,更像是在随机给分。这组对比无可辩驳地证明:新裁判是一把真正有区分度的量尺。
高分神话的终结:主流框架得分普遍暴跌15%~22%
再用这把量尺去量记忆框架时,此前的高分瞬间蒸发。在旧基准下表现亮眼的Mem0、MemOS等,在LoCoMo-Refined的严格裁判下,得分普遍下降了15到22个百分点。一些曾经接近90分的框架,新得分可能已跌至70分上下;而那些涉及时间推理、多事件区分和精确细节回忆的题目,失败率更触目惊心。
这一结果不仅量化了“高分幻象”的程度,更揭露了一个残酷事实:当前记忆系统在长对话场景中的实际瓶颈,远比旧榜单呈现的严重。问题不再是“记忆框架能不能记住”,而是“它们记住的究竟是不是对的、是不是全的、是不是没有多余的”。LoCoMo-Refined成功地将这些容易被忽略的错误类型摆上台面,为研究者指明了明确的优化方向。
建立更健康的记忆评测生态,开源一切帮你上手
LoCoMo-Refined的使命并非打击特定框架,而是为整个Agent记忆社区提供一个中立、严格、透明的检验工具。团队希望它能够成为开发者们的“压力测试仪”,在方案上线前暴露真实短板,从而避免在用户面前翻车。
为此,LoCoMo-Refined的完整修订版数据集、配套的严格评测脚本以及技术报告已全部开源。你可以在GitHub上找到它:https://github.com/mem-eval-suite/LoCoMo_refined。开发者可以基于此搭建自己的记忆评测流水线,对记忆框架进行多维度分析,并借助多模态标记洞察图文混合记忆的瓶颈。
当评测的“尺子”变得精准,记忆系统的迭代才会有的放矢。南京大学与上海人工智能实验室的这项工作,为Agent记忆赛道拉下了旧时代的幕布,也开启了一个以真实能力为导向的新阶段。对于所有正在锤炼“记忆”这一Agent核心竞争力的团队来说,是时候用LoCoMo-Refined重新检验自己的真功夫了。
从更高的视角看,这场记忆评测的大洗牌提醒我们:在AI狂奔的道路上,工具和基准的严谨性往往滞后于技术本身的热情。当高分成为常态,我们需要的不是庆祝,而是一把能刺穿泡沫的针。LoCoMo-Refined正是这样一根针,它刺痛的也许是一些夸大的数字,但最终治愈的将是整个行业的信任危机。