微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 MNIST又回来了,这次它成了考验AI智能体的"密室逃脱"

MNIST又回来了,这次它成了考验AI智能体的"密室逃脱"

2026-09-22 17:24
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-22 17:24 • 科技行者

你可能觉得手写数字识别这件事早就被解决了。

确实,MNIST数据集从1998年诞生到现在,已经快三十年了。随便一个能跑起来的神经网络,在这上面都能刷到99%以上的准确率。这几乎是深度学习领域公认的"入门题",简单到很多教程都懒得展开讲。

但新加坡南洋理工大学的研究者们干了一件挺有意思的事:他们把这道"入门题"重新包装了一下,结果发现,那些号称能达到人类水平、甚至超越人类的顶尖多模态大模型,在这道题上摔得鼻青脸肿。

这就是本文要讲的MNIST-PRO。它不是要重新挑战数字识别本身,而是把一个简单到不能再简单的任务,套上了一层"partial observability"(部分可观测)的枷锁,专门用来暴露AI智能体身上一个此前很少被单独测量的缺陷。

**这个缺陷不是"看不清",而是"记不住、拼不对、改不了"。**

难在哪里:眼睛没瞎,脑子却糊了

先说清楚问题出在哪儿。

日常生活中我们评测AI的视觉能力,通常是这样的:把一整张图片喂给模型,问它这是什么。图片是完整的,信息一次性给够,模型只需要做一次"识别"。这就好比考试时,题目和所有材料都印在卷子上,你打开卷子那一刻,该看的都能看到。

但现实世界的AI智能体不是这样工作的。想象一个机器人在探索一个房间,或者一个AI在操作手机界面完成某个任务,它任何时刻能看到的都只是局部,它得靠移动、点击、翻页去主动获取信息,还得把之前看到的碎片在脑子里拼成一张完整的地图。

这种"边看边拼"的能力,论文里管它叫agentic perception(智能体感知)。

*智能体感知:AI主动收集观察信息,构建一个随时间演化的"感知状态",用来支持决策的能力。它和传统的主动视觉(active vision)不完全一样,主动视觉只关心"往哪看",而智能体感知还要管"看到的东西怎么存、怎么用"。*

问题是,过去评测这种能力的基准测试,都有各种各样的"噪音"混在里面。比如ALFRED这类三维具身智能基准,需要智能体在虚拟房间里走路、开门、拿东西,一旦智能体撞墙了、抓取失败了,你很难说清楚这次失败到底是因为它"没看懂"环境,还是因为它"操作技巧"不行。感知能力和运动控制能力被搅在了一起,没法拆开来看。

研究者们于是想了个办法:既然要隔离出"感知"这一件事,那就干脆挑一个模型早就滚瓜烂熟、不存在识别难度的任务,然后只往里面加一种干扰:让它看不全。

这就是MNIST被选中的原因。控制变量的思路很清楚,数字识别的难度已经被摁到接近于零,如果模型还是频繁出错,那问题就一定出在"看不全导致的记忆和整合"上,而不是"认不出数字"上。

MNIST-PRO是怎么设计的:一扇会移动的小窗口

具体的玩法是这样。

原始的MNIST图片被放大到224×224像素,但智能体看不到全貌。系统在图片上盖了一层遮罩,只留出一个64×64像素的小窗口,这个窗口就是智能体唯一能看到的区域。它必须通过"上下左右移动"这四个动作,把这个小窗口在画布上挪来挪去,一点一点地把整张图看全,然后才能做出判断,报出这个数字到底是几。

这套流程被形式化成了一个叫POMDP(部分可观测马尔可夫决策过程)的数学框架。

*POMDP:一种决策模型,描述的是智能体在无法完全看到环境真实状态的情况下,只能依靠局部观察和历史记忆来做决策的过程。它和普通MDP的区别就在这个"部分可观测"上。*

论文把整个决策循环拆成了几个环节:智能体先获取当前位置的局部观察,然后把这次观察和之前积累的信息整合成一个"感知状态",接着解读这个状态,判断证据是否足够,如果够了就下判断,不够就继续探索。这个拆解特别关键,因为它让研究者能精确定位到底是哪一步出了问题:是压根没收集到足够信息,还是收集到了但没整理好,还是整理好了但解读错了。

任务被分成了两个难度级别。

第一级是单个数字,智能体只需要在一个坐标系里找到中心那个数字。第二级是把两个数字横向拼接在一起,智能体不仅要认出两个数字分别是什么,还得记住它们的先后顺序,别把"58"看成"85"。这个设计相当于是从"记住一件事"升级到"记住两件事并且不能搞混谁先谁后",专门用来测试智能体在信息量翻倍时会不会崩溃。

四种记忆方式:给AI的"脑子"换配置

MNIST-PRO最有意思的地方,是它系统性地比较了四种不同的"记忆架构",看看智能体到底该怎么把碎片信息存起来。

第一种叫Image Only Baseline(纯图像基线),就是把智能体走过的所有历史截图原封不动地堆在对话记录里,不做任何文字总结,全靠模型自己在一堆图片里做"空间积分",脑补出走过的路径和看过的内容。

第二种叫Textual State(文本状态),要求智能体每走一步都写下自己的"想法",比如"我看到中间有一道弯曲的笔画,我打算往下移动去追踪这个圈"。这些想法会累积成一段不断增长的文字描述,成为智能体唯一能依赖的记忆,因为在这种设置下,系统规定它不能再看之前的截图了,只能靠文字记住。

第三种叫Metric Grid Map(度量网格图),比文本状态更进一步,要求智能体在写想法的同时,还要维护一份结构化的坐标记录,标明"我现在在坐标[0,0],这里是空白背景",通过累加每一步移动的位移量来推算自己走到了哪里。

第四种叫Visual Memory Canvas(视觉记忆画布),这个是研究者额外设计的分析工具,思路是让程序自动把智能体看过的每一小块拼到一张大画布上,坐标对齐,不需要模型自己费劲去脑补空间关系。

这里有个特别值得琢磨的设计细节:视觉记忆画布还分成了在线和离线两种模式。在线模式是每走一步就把新画布展示给模型看,离线模式是等模型探索完了、该看的都看过了,再一次性把完整拼好的画布甩给它做最终判断。

这就好比你在拼一幅一千片的拼图。在线模式相当于你每拼上一片,就有人在旁边不停地把当前这个"缺胳膊少腿"的半成品拿给你看,不断提醒你"你看现在长这样"。离线模式则是你自己闷头把该拼的碎片都拼完,最后再退后一步,看着接近完整的图案做判断。如果一直被半成品打断,你的判断反而可能被那些不完整的、误导性的中间状态带偏,这恰恰是论文观察到的现象:持续展示不完整状态会干扰模型,而等积累够了证据再展示,效果明显更好。

结果一:认得出≠拼得对

论文测试了十个模型,包括Gemini、Claude、GPT系列的多款版本,以及开源的Qwen和GLM。先看它们在完整无遮挡图片上的表现,几乎所有模型都能拿到83%到99%的高分,这印证了前面说的,MNIST识别本身对这些模型来说完全不是难事。

但一旦切换到部分可观测模式,哪怕给智能体无限制回看所有历史截图的权限(也就是H=∞的设置),分数就开始跳水。

Gemini-3.1-Pro-Preview从99%的满分状态直接摔到38%。Claude-5-Sonnet从94%掉到24%。这个落差意味着,被动地"认出一张完整图片"这件事和主动地"把碎片信息拼出一张完整图片再认出来",根本是两种能力,前者强不代表后者也强。

原生多轮对话设置下的表现更能说明问题。研究者设计了一个最贴近真实场景的测试:给智能体一句任务说明和第一张截图,之后每一轮它只能看到上一步动作导致的新截图,没有额外提示,完全靠自己判断该往哪走、该什么时候停下来。

结果呈现出两种截然不同的失败模式。

Claude系列的模型探索得很勤快,平均走了十几到二十几步,但准确率却上不去。比如Claude-5-Sonnet平均走了15.96步(单数字任务),依然只有23%的正确率,走到双数字任务时步数飙升到43.24步,正确率却直接归零。这说明它们收集了大量信息,却没能把这些信息正确地组织和解读出来。

另一边,GPT-5.6-Sol、Qwen-3.8-27B、GLM-4.6V这几个模型则表现出完全相反的毛病:它们走得特别少,GLM-4.6V平均只走2.76步就急着给答案,双数字任务的正确率直接是0%。这类模型的问题不是拼不对,而是压根没收集够信息就自信满满地下了结论。

**这两种失败模式加在一起,说明了一件事:光靠给模型更长的对话历史,解决不了感知状态构建这个根本问题。**

结果二:给记忆换个格式,结果天差地别

接下来研究者系统地比较了前面提到的三种内部记忆机制。

一个特别反直觉的发现是:单数字任务和双数字任务里,哪种记忆方式表现最好,答案居然是相反的。

单数字任务里,八个专有模型中有七个在"纯图像历史"这种最朴素的设置下表现最好。比如Gemini-3.7-Flash在图像历史下能拿到65%,换成文本状态反而掉到54%。但一到双数字任务,风向立刻反转,纯图像历史的表现普遍很差,Gemini-3.1-Pro-Preview只剩5%,反而是依赖文本或网格坐标的模型能爬到20%上下。

这个现象背后的原因其实不难理解。任务越简单,图片本身携带的原始信息就越有价值,模型直接盯着一堆截图去脑补空间关系是可行的。但任务一旦变复杂,需要记住的东西一多,纯靠"看图脑补"的方式就撑不住了,反而是那些经过文字提炼、压缩过的记忆更管用,因为文字帮模型把关键信息提前筛选和固定了下来。

这就好比你要记住一条只有三个路口的回家路线,脑子里过一遍沿途画面就够了,根本不需要写下来。但要是换成一条要经过十几个红绿灯、拐十几个弯的陌生路线,光靠脑补画面就很容易记岔,这时候写下"第三个路口右转,第七个路口有加油站左转"这种文字提示,反而比脑子里过电影可靠得多。如果这时候还硬撑着不写字条,凭记忆硬闯,走错路的概率会大大增加。

网格坐标记忆(Metric Grid Map)的表现则更加参差不齐。它对有的模型是加分项,比如Gemini-3.7-Flash用了网格地图后从54%涨到57%;但对另一些模型反而是减分项,比如Gemini-3.1-Pro-Preview从56%跌到53%。这说明"额外维护一份坐标记录"这个动作本身也有认知成本,做路径积分需要精力,这份精力占用了模型本可以用来做别的判断的资源,对于本来路径积分能力就弱的模型,这笔额外开销反而成了负担。

结果三:双数字任务,问题不在"看没看到"

论文对双数字任务失败的诊断做得相当细致。

研究者审查了1600条双数字任务的探索轨迹,归纳出了三种典型的失败方式。

第一种是过早停止。智能体看了一个数字后,把旁边的空白区域误判成"序列已经结束",压根没去看第二个数字就直接下结论了。数据显示,323次预测里只识别出了一个数字,其中238次完全没有探索到第二个数字的任何一个像素,这些случай平均只用掉了78步预算里的15步,就早早收工了。

第二种是"说一套做一套":智能体的文字记录里写着"我要去探索一片新区域",但实际动作却是重复跑到之前已经去过的地方,脑子和手不同步。

第三种是最耐人寻味的,也是论文着重强调的:一旦某个错误的判断被写进了记忆,后面就算看到了推翻这个判断的新证据,模型也很难去修正它。

论文给了Gemini-3.7-Flash一个具体的例子。研究者检查了39个"两个数字都构建出了状态但最终预测出错"的案例,发现其中17个案例存在这种"携带错误信念"的情况,而这17个里有15个,最终提交的答案依然沿用了那个错误的判断,哪怕后续证据已经指向了别的方向。

这就好比你刚认识一个人时,第一印象觉得他很内向,后来相处中明明看到他在朋友聚会上侃侃而谈、活跃得不得了,你脑子里那个"内向"的初始标签却依然固执地留在那里,没有被更新。如果人一直不修正第一印象,只会越走越偏。同样的道理,如果智能体的记忆系统只负责往里面加东西,却没有一个"回头检查并修正"的机制,那么早期的一个小错误就可能一路带偏到最后。

为了验证"看没看到"到底是不是主要瓶颈,研究者算了一个叫"最小观察覆盖率"的指标,就是两个数字里被看得最少的那个到底被覆盖了百分之多少。结果发现,即便覆盖率超过75%,也就是两个数字几乎都被看全了,最终的精确序列准确率也只有26%。

**这个数字很扎心:不是没看够,是看够了也记不对、用不好。**

结果四:外部拼图帮了大忙,但也暴露了新问题

既然智能体自己在脑子里拼图效果不好,那如果用程序帮它拼呢?

答案是,效果确实提升明显。

这就是前面提到的离线视觉记忆画布实验。研究者拿出智能体在"纯图像"和"文本状态"两种设置下走过的真实轨迹,不改变探索路径本身,只是额外把这些轨迹里看到的碎片自动拼成一张对齐好的画布,喂给同一个模型做最终判断。

Claude-5-Opus和Claude-5-Fable在这个实验里表现极为亮眼。它们本来在文本状态设置下的探索覆盖率就很高,单数字任务能覆盖到83%左右的笔画区域,但受限于自己脑子里拼图的能力,正确率一直卡在40%左右。可一旦给它们提供拼好的离线画布,正确率直接飙升到76%到81%,翻了将近一倍。

这个结果非常有说服力,因为轨迹本身没变,唯一变的是呈现方式。这说明这些模型的瓶颈根本不在"探索能力"上,它们看得已经够多了,缺的是一个靠谱的拼图助手。

**同样的证据,换一种整理方式,效果能差出一倍。**

但故事没有这么简单。研究者还做了一个更精细的"换判官"实验,把GPT-5.6-Sol(xhigh)走过的轨迹拼成画布,然后分别让GPT-5.6-Sol自己判断和让Gemini-3.7-Flash来判断同一张画布。单数字任务上,同样的画布,换成Gemini来看,准确率从66.5%跳到84.3%,涨了将近18个百分点。这说明即便是同样完整的证据摆在面前,不同模型的"解读能力"也天差地别。

而反过来,用GPT-5.6-Sol的双数字文本状态轨迹拼成的画布,即便换成Gemini-3.7-Flash来判断,提升也很有限,从26%只涨到33%。原因很简单,因为GPT-5.6-Sol的这批轨迹里,只有38%真正观察到了两个数字的笔画,剩下62%压根就漏掉了其中一个数字,画布拼得再好,缺的信息也变不出来。

这个对照实验相当漂亮地把"证据够不够"和"解读得对不对"这两件事彻底剥离开了。就像你请两个不同的侦探来看同一份卷宗,如果卷宗本身就缺了关键证物,再厉害的侦探也破不了案;但如果卷宗完整,两个侦探破案率却天差地别,那问题就出在推理能力上,而不是证据本身。

结果五:给AI一个真正的"工具箱"之后

论文最后还测试了一种更贴近实际使用场景的模式,给智能体接入一个真正的agentic harness(智能体工具箱),允许它自己创建文件、写代码、执行程序,来完成整个任务。

*Agentic Harness:一套允许AI模型自主调用外部工具(比如写文件、跑代码)的运行环境,模型在这套环境里拥有更大的自主权,可以自己决定用什么策略解决问题,而不是被限定在固定的对话轮次里。*

这里出现了两个模型截然不同的表现。

GPT-5.6-Terra在这种自由度更高的环境下,几乎没有进步,单数字任务准确率还是31%左右,跟没上工具箱时差不多。更有意思的是,研究者给它加了"跨轮次持久记忆"的功能,希望它能把上一次学到的有用技巧存下来,供以后的任务复用。追踪发现GPT-5.6-Terra确实发现了一个挺聪明的技巧,用ASCII字符把视觉画布重建出来,这个方法也确实被记进了它的持久记忆里,可它后续调用这个技巧的比例只有大约2%。知道了好办法,却几乎不用,持久记忆没能转化成持久习惯。

Gemini-3.7-Flash的表现则完全不同。它在工具箱环境下,准确率从原来在线画布模式的68%直接飙到88%(单数字任务),双数字任务也从38%涨到63%,涨幅高达20到25个百分点。

追踪它的行为轨迹后发现了原因:这个模型自发地写出了叫stitch.py和render_mnist.py的小程序,自己把探索过程中拍下的碎片读出来、拼接、渲染成一张ASCII风格的画布,反复审视这张自己拼出来的图,然后才做出最终判断。

**这个策略是它自己摸索出来的,没有人明确告诉它要这么做。**

这一点特别值得琢磨。工具箱本身只是允许模型读写文件、跑代码,从来没有明确指示"你应该把碎片拼成画布",但这个模型自己就找到了这条路。这有点像给一个学生一间配备了打印机、剪刀、胶水的自习室,没人教他怎么复习,结果他自己想出了"把散乱的笔记剪下来重新拼贴成一张思维导图"这个方法,效果比死记硬背好得多。如果这间自习室里什么工具都没有,只给他一沓白纸,他大概率就只能硬扛着脑子记,效果自然打折扣。

不过持久记忆对Gemini-3.7-Flash同样没有带来额外提升,反而让它在双数字任务上花的步数暴增,从41步涨到63.67步,准确率却没什么变化。这说明记住"拼图这个套路"确实有用,但记住之后反而让探索变得更啰嗦,没有换来更高的正确率。

一些更细的观察:数字的"长相"也会影响结果

论文还挖掘了一个挺有意思的细节,不同数字的几何形状复杂度,直接影响了识别的难易程度。

数字被分成了三类:像1、4、7这种笔画简单、几乎没有弯曲的直线型数字;像2、3、5这种带明显曲线的数字;以及像0、6、8、9这种带闭合圆圈的数字。

**结果呈现出清晰的规律:直线越多越好认,圈越多越难认。**

有意思的是,网格坐标记忆对这两类数字的影响是相反的。它对曲线类数字确实有帮助,Gemini-3.7-Flash在曲线数字上的成功率从36.7%涨到56.7%,但对闭环类数字反而是拖后腿的,同一个模型的闭环数字成功率从57.5%掉到45%。

这也不难理解。追踪一条弯曲的曲线,靠坐标记录能帮你精确定位这条线走到哪儿了,就像给一条蜿蜒的山路每隔一段标一个里程碑。但一个封闭的圆圈,起点和终点是重合的,硬要用线性的坐标序列去描述一个环形结构,反而容易在记录的时候引入混乱,这就像非要用一条笔直的时间线去描述一个循环发生的事件,两种结构本身就不太兼容。

写在后面

读完这篇论文,最触动我的其实不是那些准确率数字的高低起伏,而是那个关于"过早停止"的发现。

那些用两三步就仓促下结论的模型,比如GLM-4.6V,它们手里握着足够的探索预算,完全可以把整块画布系统性地扫一遍,却选择在只看到一小片证据的时候就自信地报出答案。论文提出了一个挺有意思的猜测:这很可能是模型对MNIST这个数据集太熟悉了,脑子里对"0长什么样、8长什么样"有一套根深蒂固的先验知识,哪怕只看到一小段笔画,也足够激活某个"我觉得这是8"的假设,然后就懒得再验证了。

这让我想到一件挺反讽的事:正是因为MNIST太经典、太被模型"背下来"了,反而成了暴露过度自信这个毛病的最佳场地。如果换一个完全陌生的图案,模型大概不敢这么托大。论文里提到的另一项工作ScrambleToolBench恰好形成了对照,在那个完全陌生的环境里,模型反而表现出相反的毛病,宁可笨拙地穷举也不敢用推理走捷径。同一批模型,面对熟悉的领域自信过头,面对陌生的领域又谨慎过头,这种两极分化的行为模式,比单纯的"AI不够聪明"这个结论有意思多了,它说明模型的决策阈值本身就没有被校准好,校准的问题可能比能力的问题更根本。

Q&A

Q1:MNIST-PRO是什么?

A:这是南洋理工大学团队提出的一个基准测试,把经典的MNIST手写数字识别任务改造成了部分可观测的探索任务,智能体只能通过移动一个小窗口逐步查看图片,用来专门评测AI在信息碎片化情况下构建和使用感知状态的能力。

Q2:为什么模型在完整图片上准确率很高,一到MNIST-PRO就大幅下降?

A:因为完整图片识别只考验被动的视觉识别能力,而MNIST-PRO额外要求智能体主动探索、整合碎片信息并做出决策,这是两种完全不同的能力,论文数据显示部分模型准确率从99%跌到38%左右。

Q3:MNIST-PRO里哪种记忆方式效果最好?

A:没有一种记忆方式能全面胜出。单数字任务下纯视觉历史表现最好,双数字任务下文本状态或网格坐标记忆反而更优,说明记忆表示方式需要根据任务复杂度灵活调整。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-