
这项由北京大学智能科学与技术学院、心理与认知科学学院、人工智能研究院及元培学院联合发起,并与威斯康星大学麦迪逊分校合作完成的研究,于2026年6月以预印本形式发布,编号为arXiv:2606.05008。研究的核心产出是一个名为M?Eval的评测框架和基准数据集,专门用于系统性地检验多模态大模型(即能同时理解视频和文字的AI模型)究竟有没有真正的"记忆力"。
假设你请了一个助手帮你整理两段烹饪视频的内容,一段是做咖喱鸡,一段是做咖喱豆腐。看完之后,你问他:"第一个视频里,最后的菜是用什么点缀的?"他支支吾吾,把豆腐视频里的配料说成了鸡肉视频的,或者干脆把两段视频的顺序搞混了。这种情况,在人类助手身上算是严重失职,但在当今最先进的AI视频大模型身上,却是家常便饭。
研究团队发现,尽管现在的AI视频大模型上下文窗口越来越大——意思是它们能"看"的内容越来越长——但看得长和记得住是两回事。就好比一个人看了一部三小时的电影,不代表他能准确回忆起第47分钟那个配角穿了什么颜色的毛衣。真正的记忆力,涉及如何编码信息、如何存储、如何在干扰中保持清醒、以及如何在需要时精准取出。现有的视频理解评测工具,几乎没有专门针对这些维度设计的测试,大多数测试考察的是"看没看到",而非"记没记住"。M?Eval正是为了填补这个空白而生。
一、为什么AI的"记忆力"值得我们认真对待
在AI领域,多模态模型就像是一个既能看视频又能读文字的超级学生。这类模型在许多任务上已经表现得相当不错,比如回答关于一段视频的问题、描述画面内容、甚至做一些简单推理。然而,记忆这件事却长期处于评测的盲区。
记忆不仅仅是"把信息存进去"这么简单。认知心理学家几十年前就发现,人类的记忆受到多种因素的影响。编码阶段,注意力分散会导致信息储存不完整;存储阶段,相似的记忆会互相干扰,导致混淆;提取阶段,时间和干扰都会让原本清晰的记忆变得模糊。这些规律在AI模型身上是否同样存在?如果存在,又有哪些独特的表现?北京大学的研究团队决定借用人类心理学实验的框架,系统地给AI做一次"记忆体检"。
M?Eval的设计灵感,直接来源于认知心理学中久经考验的实验范式。研究团队把这些人类记忆研究的经典方法,改造成了视频问答任务,并在此基础上搭建了一套包含四个维度的测试体系。整个基准数据集涵盖2403道题目,涉及451段视频,总时长约403小时,涵盖烹饪教程、纪录片、电视剧、电影等多种真实场景,规模相当可观。
二、四道关卡:从四个角度拷问AI的记忆
研究团队设计的四个测试维度,各自对应一种人类记忆研究中的经典挑战,覆盖了空间维度和时间维度两大方向。
第一个维度叫做"分散注意力测试",考察的是AI在同时接收两路视觉信息时,能否分别记住每一路的内容。这个设计来自心理学中的"双任务范式"——人类在同时做两件事的时候,两件事的表现都会下降,记忆的质量也会打折。实验的具体做法是:把两段内容相似的视频并排放在一个屏幕上,左边一段,右边一段,同时播放。有时候,这两段视频的左右位置还会被频繁互换,考验AI能否追踪每段视频的真实身份。问题分三类:第一类问的是"某个细节来自哪段视频",考察来源辨别能力;第二类问的是"某段视频里的事情发生的先后顺序",考察时序记忆;第三类问的是"某段视频里有没有这个细节",考察内容保留能力。
第二个维度叫做"记忆干扰测试",考察的是相似内容对AI记忆的破坏程度。这源自心理学中的"记忆干扰理论"——人类忘记事情,很多时候不是因为记忆自然消退,而是因为相似的记忆相互竞争、相互覆盖。干扰可以来自两个方向:一个是"前摄干扰",也就是早先学的内容妨碍后来的记忆;另一个是"逆摄干扰",也就是后来学的内容破坏了早先的记忆。测试的做法是把两段相似的视频前后拼接,然后就其中一段提问,通过改变两段视频的先后顺序来分别测量这两种干扰效应。答案选项中不仅有正确答案,还故意放入来自另一段视频的"入侵选项",用于统计AI被"带偏"的比例。
第三个维度叫做"交错事件测试",考察AI能否在混乱的呈现顺序中重建事件的真实脉络。这个设计来自心理学家曼德勒的经典研究:把两个独立故事的片段交替呈现给人类,人们往往能自动把同一故事的片段归拢在一起,还原出原本的叙事结构。研究团队把两段视频各切成10段,然后像洗牌一样交替排列:第一段视频的第一片段、第二段视频的第一片段、第一段视频的第二片段……依此类推,组成一条混乱的视频流。AI要在这种混乱中识别出哪些片段属于同一来源,并还原出每段视频的原始顺序。这个维度额外增加了一种"虚假记忆辨别"题型,灵感来自心理学的DRM范式:提问中描述的事情根本没有在任何一段视频中出现,考察AI能否识破这种陷阱,而不是捏造一个"记忆"来回答。
第四个维度叫做"N-Back符号记忆测试",考察AI能否对视频内容做出抽象的符号化归纳,并在时间跨度中维持这种符号记忆。N-Back任务是认知心理学中测量工作记忆容量的经典方法:给出一串刺激,要求判断当前刺激是否和N个位置之前的刺激相同。研究团队把这个范式改造成了视频版本:给AI看一串短视频片段,然后问它"第12段视频和第9段视频是否描绘了同样的场景类型",或者"是否描绘了同样的动作类型"。通过调整N(也就是"隔了几段")和总视频数量K,可以系统地测量AI在时间跨度和信息量双重压力下的记忆表现。
三、测试结果:AI的记忆,和人类究竟差在哪里
研究团队用这套测试体系评估了多款代表性模型,包括Gemini 3.1 Pro Preview、GPT-5.4两款商业闭源模型,以及Qwen3-VL、Qwen3.5系列、InternVL3.5等多款开源模型,还有VideoLucy、M3-Agent两种具备自主记忆策略的"智能体"系统,并同时收集了人类参与者的表现作为对照基准。结果相当触目惊心。
在分散注意力测试中,人类的表现相当稳定,三类题目的正确率均在89%到92%之间,即便在左右频繁互换的干扰条件下,也只下滑了5到8个百分点。AI模型的情况则截然不同,绝大多数模型在三类题目上的表现都接近随机猜测水平(四选一的随机正确率是25%),只有Gemini 3.1 Pro Preview在来源辨别上勉强达到62.5%。更有意思的是,当左右位置频繁互换时,来源辨别的准确率大幅下滑,而顺序理解和内容保留几乎不受影响。这说明位置互换主要打乱的是AI对"内容来自哪里"的判断,而不是对内容本身的记忆。
研究团队进一步分析了AI在处理分屏视频时的注意力分布图,发现了一个清晰的模式:在单一视频条件下,模型的注意力集中在被问及的区域;而一旦换成分屏条件,注意力分布就变得散漫和混乱,大量注意力"溢出"到了与问题无关的另一侧视频上。这揭示了AI分散注意力失败的根本原因——模型尚不具备在两路并行视觉流之间独立维持注意力的能力,两路信号会在内部相互干扰。
记忆干扰测试带来了几个出人意料的发现。在人类参与者身上,逆摄干扰(后来的信息破坏早先的记忆)明显强于前摄干扰(早先的信息妨碍后来的记忆),这与心理学界几十年来的研究结论完全吻合。人类的准确率差异高达20个百分点——在逆摄干扰条件下只有74.55%,在前摄干扰条件下则有94.55%。然而,AI模型却几乎没有表现出这种不对称性,两种干扰条件下的准确率相差甚微,甚至有多款模型出现前摄干扰比逆摄干扰更严重的反转现象。这说明AI的记忆机制与人类存在根本性的不同——人类的注意力天然倾向于给最新信息赋予更高权重,而Transformer架构的AI模型对所有时间位置的信息一视同仁。
另一个让研究团队意外的发现是:重复视频内容,反而能提升AI对目标视频的理解准确率。无论是重复目标视频(让模型看两遍要被提问的那段),还是重复干扰视频(让模型看两遍另一段),最终对目标视频的回答准确率都有所提升。研究团队的解释是:对于基于因果注意力机制的Transformer模型,后出现的内容可以"回望"先出现的内容,而先出现的内容无法预知后续。重复某段视频,相当于在序列中又放了一个可以被后续内容关注的锚点,这使得模型对重复的那段视频形成了更清晰的表征。
交错事件测试的结果同样让人印象深刻。人类在四类题目上的正确率介于76%到84%之间,而AI模型几乎全面落败,最好的商业模型(Gemini和GPT-5.4)也只能勉强达到43%到50%,大多数开源模型在30%上下徘徊,部分甚至跌破随机水平。尤其是虚假记忆辨别这道题,人类有82%的概率能识破陷阱,选择"这件事根本没发生在任何视频里",而多数AI模型的正确率竟然低于随机水平的25%——换句话说,它们不仅没能识破陷阱,反而比随机猜测更倾向于捏造一个不存在的"记忆"来回答。
此外,研究团队还专门对比了AI在空间维度和时间维度上的来源定位能力。所谓空间来源定位,就是判断某个内容来自分屏左边还是右边的视频;时间来源定位,则是判断某个内容来自交错序列中的第一段视频还是第二段视频。对比结果显示,几乎所有模型在空间定位上都比时间定位表现更好,差距普遍在2到15个百分点之间。这个规律在人类参与者身上也存在,只是程度较轻。这说明时间维度上的来源追踪,对人类和AI来说都是更困难的任务,而AI在这方面的短板尤为突出。
N-Back符号记忆测试揭示了AI与人类在记忆机制上最根本的结构性差异。在人类参与者身上,随着N值的增大(也就是需要回忆的片段间隔越来越远),正确率呈现单调下降趋势,这完全符合工作记忆容量有限的理论预期。而当总视频数量K增加时,人类的准确率下降得相对平缓,因为人类有能力把不相关的信息从工作记忆中清除出去。AI模型的表现则完全相反:随着N的增大,准确率不降反升,甚至有所提高;但随着K的增大,准确率急剧下滑。这揭示了Transformer架构的一个内在特性——全局注意力机制让模型对所有历史信息保持大致相同的可访问性,时间距离对它来说几乎没有遗忘效应;但当需要处理的信息总量膨胀时,模型就难以从中过滤出真正相关的部分,准确率随之崩塌。换句话说,人类会忘记久远的信息,但善于忽略无关信息;AI不会因为距离而遗忘,却无法忽视无关信息的干扰。
还有一个细节值得关注:在N-Back测试中,人类对场景类别的记忆优于动作类别,而多数AI模型的表现刚好相反——对动作的判断更准确,对场景的判断反而较差。这种偏好差异背后的原因,目前研究团队尚未给出明确解释,但它至少说明AI和人类在抽象和归纳视频信息时,采用的内部策略存在系统性的差异。
四、这些发现对未来AI的设计意味着什么
M?Eval不仅仅是一套测试工具,它的发现同时也指向了几个值得深入探索的改进方向。
针对分散注意力的问题,研究团队建议未来的模型需要在注意力机制层面做出改进,让模型能够在处理并行视觉流时为每条流维持独立的内部表征,而不是让两路信号在同一个注意力空间里混战。这对于自动驾驶(需要同时处理多路摄像头画面)、家庭机器人(需要同时关注多个场景)等实际应用场景来说,具有直接的现实意义。
针对记忆干扰问题,重复策略的意外成效给了研究者一个启发:主动地在上下文中重复关键信息,可能是一种简单而有效的提示工程技巧,尤其对于需要在长视频流中记住特定细节的任务。
针对时间维度的来源定位弱点,研究团队认为需要开发能够更好地捕捉事件之间时序关系的模型架构,让AI不仅能记住"发生了什么",还能可靠地记住"什么时候发生的,在哪段视频里发生的"。
针对符号记忆的局限,引入某种"遗忘机制"或"信息过滤机制"被认为是一个有前景的方向。当前的Transformer模型把所有历史信息一视同仁地保留在注意力池中,而人类则会主动将不再相关的信息从工作记忆中清除。如何让AI也具备这种"主动遗忘"的能力,可能是未来记忆机制设计的重要课题。
归根结底,北京大学的这项研究做了一件很有价值的事:它用严谨的实验设计,把一个长期被模糊对待的问题——AI的记忆力——变得可以精确测量和系统分析。这让我们第一次有机会不是凭感觉,而是凭数据来讨论"AI到底记得多好"这个问题。
当然,M?Eval本身也有其局限性。目前的测试场景以两段视频的对比为主,现实中的复杂场景可能涉及更多路视频流、更长的时间跨度、以及更多样化的干扰类型。此外,人类参与者的样本规模目前相对有限,未来如能扩大规模,数据会更有说服力。不过,作为一个系统性评测框架的首次尝试,M?Eval提供的工具和发现,足以为这个领域接下来的研究指明具体的方向。
下次当你看到某款AI视频助手声称自己能理解几小时的长视频时,不妨想想这项研究:能看完和真的记住,依然是两件截然不同的事。有兴趣深入了解这项研究的读者,可以通过编号arXiv:2606.05008查阅完整论文。
---
Q&A
Q1:M?Eval测试框架主要测的是什么能力?
A:M?Eval专门测试AI视频大模型的"记忆力",具体包括四个维度:同时处理两路视频时的注意力分配能力、面对相似内容时的抗干扰能力、从乱序片段中重建原始事件结构的能力,以及对视频内容做符号化归纳并跨时间追踪的能力。这四个维度分别对应心理学中的经典记忆研究范式,是目前首个系统针对视频理解场景下AI记忆能力的评测框架。
Q2:AI大模型在记忆干扰测试中为什么和人类表现差异这么大?
A:人类记忆天然倾向于给最新信息更高权重,所以"后来的信息覆盖早先的记忆"(逆摄干扰)远比"早先的信息妨碍后来的记忆"(前摄干扰)更强烈,两种条件下准确率差距高达20%。AI模型由于Transformer架构对所有时间位置的信息一视同仁,两种干扰效应几乎没有差别,说明AI的记忆机制与人类存在根本性的结构差异。
Q3:N-Back测试中AI为什么时间间隔越大反而表现越好?
A:这是Transformer全局注意力机制的内在特性导致的。人类随着回忆间隔增大会逐渐遗忘,而AI模型对所有历史信息保持大致相同的可访问性,时间距离几乎没有遗忘效应。间隔越大时,问题相对变得"更纯粹",反而减少了中间信息的干扰。但当总视频数量增加时,AI无法过滤无关信息,准确率就会急剧下滑,这与人类能主动清除无关记忆的机制截然相反。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。