
你有没有遇到过这样的同事:明明手册上写着"if门锁打不开,检查是不是换了新钥匙",他偏偏还是站在门口,拿着旧钥匙一遍又一遍地插,插不进去就换个角度再插,插了二十次也没想起来去翻手册。
这听起来像是个笑话,但新加坡南洋理工大学DeCLaRe实验室的研究团队发现,当前最顶尖的大语言模型智能体,干的就是这件事。他们设计了一个叫ScrambleToolBench的测试环境,把工具的名字和说明书全部抹去,只留下一个个乱码般的接口,逼着AI通过反复试验去搞懂每个工具到底是干什么的。结果AI确实学会了,学得还不错。可一旦研究者悄悄把工具的身份牌互相调换了一下,AI手里明明攥着自己刚记下的笔记,却完全没想到去翻一翻,而是选择从头开始,把所有工具挨个试一遍。
这篇论文的题目起得很直白:《智能体依然会做穷举式搜索,即便他们自己的地图已经指明了下一步》。这句话本身就是整篇研究最扎心的结论。
当说明书被撕掉之后,AI还剩下什么
我们平时看到的AI用工具的演示,基本都长这样:模型调用一个叫`read_file`的函数,参数是文件路径,然后拿到内容。这个过程之所以顺畅,是因为函数名本身就是提示。`read_file`这个词,任何受过训练的语言模型都在无数代码库里见过成千上万次,它不需要理解,只需要识别。
研究团队把这种现象叫做语义先验。
**语义先验:模型依靠训练数据中见过的命名习惯(比如函数名包含"read""search"这类词)来猜测功能,而不是真正通过观察输入输出去推理。**
问题是,现实世界没这么友好。很多企业内部系统的接口命名混乱不堪,第三方API的文档可能过时,甚至完全对不上实际行为。一个真正健壮的智能体,应该有能力在完全没有文档、没有语义线索的情况下,靠着"试一下、看反馈、调整假设"这套流程把工具摸清楚。
这就是ScrambleToolBench想要测的东西:把语言这层保护罩彻底撕掉,看AI剩下的到底是真本事还是套路。
具体怎么撕的?研究者把环境里28个核心工具的名字全部换成`fn_efc8`这种毫无意义的代号,参数名换成`arg_0`、`arg_1`,连"成功"和"失败"这两个状态词都随机换成两个乱码token。每一局游戏开始时重新洗一遍牌,保证AI没法靠记住上一局的规律来偷懒。
**这是一个刻意制造的最坏情况,目的是把行为推理这一种能力单独隔离出来测量。**
打个比方,这就像是把你扔进一个陌生国家,所有路牌、说明书、菜单都换成你完全不认识的符号,你只能靠一次次地推开门、按按钮、试试看会发生什么,才能摸清楚这个世界的规则。如果这个国家的路牌是用你熟悉的语言写的,你根本不需要"探索",直接读就行了,那测出来的就不是你的适应能力,而是你的阅读理解能力。
任务链和三种"添乱"手段
光是抹掉名字还不够。研究者还设计了一套连续任务链:一局游戏里连续给AI布置5个任务,AI必须在同一个会话里持续积累对工具的理解,前面学到的东西要能用在后面的任务上。
在这个基础上,团队加入了三种模拟真实世界混乱的机制。
第一种叫映射漂移。
**映射漂移:在两个任务之间,系统会把一部分工具的代号重新打乱分配,就像公司系统升级后,接口名字变了但功能没变。**
具体来说,28个工具里选出7个,做一次环形轮换,比如原来的`fn_A`现在变成了`fn_B`干的活,`fn_B`变成`fn_C`干的活,一直转到最后一个又转回`fn_A`。这个环的存在其实是留了一条后门,理论上AI完全可以靠着"顺藤摸瓜"把新映射摸出来,用不着从零开始瞎试。
第二种叫随机动作失败。
**随机动作失败:每次调用工具都有一定概率(论文里设的是15%)返回一个超时错误,就算你调用的方式完全正确。**
这是在模拟网络抖动这种现实里常见的噪音,考验AI能不能分清楚"这次失败是我调用方式错了"还是"这次纯粹是运气不好,重试一下就行"。
第三种叫时间执行窗口。
**时间执行窗口:某些任务一旦触发某个动作,就必须在接下来固定的步数内(比如10步)完成整套操作,超时系统会重置状态,之前存的中间变量全部作废。**
这个机制专门用来惩罚那种漫无目的的试探行为,逼着AI在关键时刻收起好奇心,只做自己有把握的动作。
三种机制单独测,也能叠加起来一起测,叫做"全部叠加"(+All)条件,模拟一个既会随机抽风、又会悄悄改名、还有紧急时间压力的系统,基本上就是把生产环境里能出的乱子都凑齐了。
数字说话:从93%到3%的断崖
论文测试了15个模型,从开源的Qwen、Gemma、GPT-OSS系列,到闭源的GPT-5.4、Gemini系列和Claude系列。
先看一个对照实验。在没有任何混淆的正常环境里,也就是工具名字保持原样,几乎所有模型的任务完成率都在60%以上,顶尖模型比如Gemini 3.1 Pro、Claude Sonnet 5能做到100%全部完成。这证明这些模型确实会用工具,起码在"读得懂说明书"这个层面没问题。
可一旦把名字换成乱码(基础混淆条件),画风突变。Gemma 4 26B-A4B、GPT-5.4 Mini、Gemini 3.1 Flash Lite这些模型的完成率直接归零,说明它们压根不具备脱离语义提示、纯靠试验摸索工具功能的能力。只有少数几个顶尖模型比如Gemini 3.1 Pro、Gemini 3.5 Flash、Claude Sonnet 5还能维持100%的完成率,证明它们真的能通过观察和试验把工具摸透。
接下来是这篇论文最核心的发现。当三种"添乱"机制叠加在一起时,平均完成率从93%暴跌到3%。
这不是渐进式的下滑,这是断崖式的崩溃。
之前在基础混淆条件下还能维持100%完成率的Claude Sonnet 5,在全部叠加条件下直接掉到0%。全场十五个模型里,只有Gemini 3.1 Pro(20%)和Gemini 3.5 Flash(25%)还能在没有外部记忆辅助的情况下勉强解出一点任务。
| 模型 | 无混淆 | 基础混淆 | +漂移 | +失败 | +窗口 | +全部叠加 |
|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1.00 | 1.00 | 0.90 | 1.00 | 0.80 | **0.20** |
| Gemini 3.5 Flash | 1.00 | 1.00 | 0.90 | 0.85 | 0.65 | **0.25** |
| Claude Sonnet 5 | 1.00 | 1.00 | 1.00 | 1.00 | 0.70 | 0.00 |
| 平均值(不含记忆增强) | 0.93 | 0.32 | 0.23 | 0.26 | 0.19 | **0.03** |
数字背后藏着一个更值得琢磨的问题:为什么会崩得这么彻底?
为什么AI有地图却不用地图
研究团队做了一件很聪明的事:他们没有停留在"完成率掉了多少"这个表面数据上,而是深挖了智能体在失败时到底在干什么。
他们发现的第一个现象叫信念惯性,也叫做"陈旧工具调用"。
**陈旧工具调用:智能体在环境已经发生映射漂移之后,依然反复调用那个已经失效的旧工具代号,仿佛完全没意识到规则变了。**
论文里举了个具体例子。Qwen 3.6 27B在某局游戏的第三个任务里,之前一直靠`fn_fc40`成功搜索文件,映射漂移之后这个代号已经指向别的功能了,调用它只会返回空结果。按理说,收到一个和预期完全不符的空结果,应该是个明确的警报信号。可这个模型在接下来的7步里,反反复复调用同一个`fn_fc40`,每次只是换个参数或者换种猜测的理由,比如"也许文件名有数字后缀"。它从没想过,问题可能根本不出在参数上,而是这个代号已经不是原来那个工具了。
这就好比你换了新手机号,朋友还在给旧号码发消息,发了十条都没回,他的反应不是"这个号码是不是停用了",而是"是不是我发的字太少了,再多写点试试"。
第二个现象更让人意外,研究团队称之为穷举回退。
面对映射漂移,理论上存在一条极其经济的破案路径,论文里管它叫环追踪。
**环追踪:由于漂移是一种环形置换(比如A变成B,B变成C,C又变回A),只要发现调用某个旧代号得到了一个"意料之外但之前见过"的函数,就可以顺着这条链条往前查,直到追到真正需要的那个函数,全程不需要漫无目的地试。**
论文用数学证明了这条路径的效率。在他们的设定里(28个工具,每次漂移打乱7个,每个任务需要4个函数),走环追踪的策略平均只需要额外4.25次调用就能定位到目标函数。而如果是纯粹的随机扫描,平均要多试14次左右(也就是28的一半)。换句话说,聪明地推理一次,能省下十次左右的无用功。
但实测结果是什么呢?Gemini 3.1 Pro在漂移发生后,只有11%的机会会在三步之内调用链条上正确的下一个代号,这个数字和纯随机蒙的10.8%几乎没有差别,统计检验显示这种表现和瞎猜没有显著区别(p=0.934)。Claude Sonnet 5稍微好一点,在14%左右,但依然只是比随机高了三四个百分点,远远称不上"学会了这个策略"。
更让人意外的是,增加模型的推理量(也就是让它多想一会儿再行动)并没有让这个数字变好。研究者把Claude Sonnet 5的推理强度从低调到高,环追踪的跟随率始终卡在11%到14%之间,没有明显提升。
**推理强度提高确实让完成率上去了,但它靠的不是学会了聪明的策略,而是让穷举搜索变得更彻底、更不容易半途而废。**
这就好比一个人做数学题不会用公式,但脑子转得够快,靠着把所有可能的答案挨个代入验证,硬是把题目蒙对了。他确实交对了答案,但你不能说他学会了这道题的解法,下次题目稍微变一下,他还是得从头蒙。论文里的数据印证了这个判断:在漂移条件下,Claude Sonnet 5用于恢复的动作数量是理论最优值的7.4到7.5倍,无论推理强度高低,这个倍数几乎没有变化。而用的token(也就是计算成本)却差出好几倍:Claude Sonnet 5每解决一个任务要花11652个token,Gemini 3.1 Pro只需要3332个,相差3.5倍。
也就是说,这些模型在用一种代价极其高昂的方式,去解决一个本可以用几步逻辑推理就搞定的问题。
记忆能救场,但救得有限
既然模型自己想不起来用地图,那给它一个更结实的地图会不会有帮助?
研究团队设计了一套记忆增强方案。给智能体配备两个持续存在的数据库:一个叫任务配方,记录着完成某类任务需要按什么顺序调用哪些工具;另一个叫工具知识库,记录着每个混淆代号对应的真实功能、参数要求和置信度。每走一步,这两个数据库都会被打包成结构化数据塞进模型的提示词里,模型也可以在自己的回答里附带一份"更新指令",主动修改这两个数据库。
这套机制确实带来了改善。在全部叠加的极端条件下,加了记忆之后,平均完成率从0.03提升到0.09(虽然基数很低,但相对提升接近两倍),平均完成任务数从0.84提升到1.43左右。Gemini 3.1 Pro的表现最亮眼,完成率从20%直接翻倍到50%,完成任务数从2.35提升到3.60。
论文里记录了一个特别生动的细节。Gemini 3.1 Pro在某局游戏检测到又发生了一次映射漂移之后,主动说了这样一句话(翻译过来):等等,我们得先搞清楚第三个任务里的工具映射,因为它们可能又被重新打乱了。让我们把之前的工具映射清空,只留任务进度这些关键信息。
这说明至少有些顶尖模型具备主动清理过期记忆的意识,这是一种相当高级的自我管理能力。但研究者也发现了反例:Claude Sonnet 4.5加了记忆之后,陈旧工具调用的次数反而从2.38次上升到2.76次,说明如果模型自己的更新策略不够谨慎,持久化的数据库反而可能把错误的信念固化下来,变成一种"顽固的错误记忆",比没有记忆时更难纠正。
这其实揭示了一个更深层的矛盾:记忆本身是中性的工具,它既能帮你记住正确答案,也能帮你把错误答案记得更牢。
这就像笔记本对学生的作用。一个善于复盘、及时划掉过时内容的学生,笔记本是他进步的加速器;而一个从不回头检查、只顾往前抄的学生,笔记本反而会让他把某个错误的公式抄了一遍又一遍,抄得越工整,错得越坚定,甚至比不记笔记的学生更难纠正过来,因为他对着笔记本产生了一种"白纸黑字应该没错"的盲目信任。
即便加了记忆,模型依然没有学会环追踪这条聪明路径。数据显示,加了记忆的Gemini 3.1 Pro,跟随链条的比率是12.8%,仍然只比随机基线的10.9%高出一点点,统计上并不显著(p=0.195)。这说明记忆解决的是"记不住"的问题,却解决不了"想不到"的问题,模型依然缺乏那种从散落的观察里推导出结构性规律的能力。
定性观察:AI在崩溃边缘的真实反应
除了统计数字,研究团队还翻看了大量具体的对话记录,总结出几种典型的行为模式。
有一种成功案例发生在时间窗口场景下。Gemini 3.5 Flash触发时间限制后,立刻意识到不能再东摸西看,直接说:现在有一个10步的时间窗口,我必须避免任何探索性调用,立刻按顺序执行三步:解码载荷、验证主机IP、提交答案。结果它真的只用三步就完成了任务,说明至少有些模型具备"收起好奇心,全力冲刺"这种切换能力。
还有一种更让人印象深刻的场景是从状态重置里恢复。Gemini 3.1 Pro在某个任务里遇到时间窗口过期导致状态被重置,它没有懵在原地,而是准确判断出:环境返回了一个无效状态错误,说明活跃的时间窗口已经过期,服务器状态被重置,我的会话变量已经失效,我没法直接提交答案了,必须退回第一步,重新触发`fn_abc1`打开新窗口,然后迅速重新执行整个序列。这段自我诊断相当精准,说明部分模型确实具备持续监控环境状态、并据此调整计划的能力。
这两个正面案例恰恰反衬出前面那些负面案例的荒诞:同样是顶尖模型,面对状态重置能够准确诊断并回退重来,面对映射漂移却选择死磕一个失效的代号。这说明问题不在于模型"不聪明",而在于它们对不同类型的环境变化,反应机制存在明显的不均衡。它们学会了识别"超时"这种时序性的、瞬时的异常,却没学会识别"这个工具的身份变了"这种结构性的、持久的异常。
这项研究和之前的工作有什么不同
在ScrambleToolBench出现之前,已经有不少工具使用类的测试环境,比如MCP-Atlas和MCP-Universe这两个基准,它们让智能体去操作真实的MCP服务器,测试智能体在真实工具环境下的表现,但这些工具的名字和说明都是保留原样的,本质上还是在考察记忆和调用能力,而不是纯粹的推理能力。
另一个叫OpaqueToolsBench的工作,倒是也做了工具语义混淆,这一点和ScrambleToolBench的思路接近,但它没有引入环境会中途变化这个维度,也就是说它测的是"你能不能第一次就摸清楚规则",而不测"规则变了你能不能反应过来"。
还有SWE-bench和OSWorld这类基准,专注于长程任务执行,比如解决真实的GitHub问题,或者操作真实的电脑界面,它们测试的是多步骤推理和错误恢复,但整个过程中底层的工具规则是稳定不变的,agent不需要怀疑自己对世界的基本理解。
ScrambleToolBench的独特之处在于,它是第一个同时做到语义混淆、任务连续、结构性漂移三件事的测试环境。前两点单独看都不新鲜,但组合在一起,恰好卡在了当前所有基准都没测过的那个盲区:如果一个AI已经通过努力摸清了规则,规则突然又变了,它能不能利用自己已经掌握的知识去快速推导新规则,而不是把之前的努力全部推倒重来。
这个盲区之所以重要,是因为它对应着真实世界里最常见的一种状况:系统升级、接口迁移、版本更新,这些事情天天在发生,一个真正能在生产环境里存活的智能体,必须具备这种"旧知识指导新推理"的能力,而不只是"从零学习"的能力。
写在后面
读到环追踪那部分证明时,我一直在想一个问题:为什么模型明明有能力做数学推理证明,却在实际操作中完全用不出这套逻辑。这不是能力缺失,这更像是一种注意力的错位。模型把大量的推理资源花在了"要不要重试这个动作""这个错误是不是噪音"这类局部判断上,却没有分配资源去做那种更抽象的、跨越多次观察的结构性归纳。
论文里那个11%对10.8%的数字,一直让我很在意。这个几乎等于随机的表现,出现在一个号称能做复杂数学证明、写代码、通过各类高难度考试的模型身上,反差感相当强烈。这说明当前的推理能力可能存在严重的领域局限:模型在训练数据里见过大量数学证明的模式,却几乎没见过"根据一系列不一致的观察去反推一个隐藏排列结构"这种模式,而这恰恰是现实世界里排查系统故障时最常用的思维方式。
这让我想到一个问题:如果把环追踪这种策略作为一种专门的训练信号加进去,模型是不是真的能学会?还是说,这种"从混乱观测中提炼隐藏结构"的能力,本质上需要一种和当前语言模型训练范式完全不同的机制才能获得?
Q&A
Q1:ScrambleToolBench是什么?
A:ScrambleToolBench是新加坡南洋理工大学DeCLaRe实验室提出的一个测试环境,专门用来检验AI智能体在完全没有工具说明、且环境规则会中途变化的情况下,能不能通过试验摸清工具功能并灵活适应变化。
Q2:为什么AI模型有了正确的工具映射记录,还是会反复调用已经失效的旧工具?
A:这被论文称为信念惯性,模型倾向于坚持之前建立的假设,即使收到明显异常的反馈(比如空结果),也不会主动怀疑规则已经改变,而是不断尝试微调参数来解释异常,而不是重新审视自己的整个认知框架。
Q3:给AI加上持久记忆能解决这个问题吗?
A:能缓解但解决不了根本问题。记忆能减少重复的无效探索,在极端混乱条件下把完成率提升了大约两倍,但模型依然学不会用逻辑推理去快速定位漂移后的工具位置,只是把原本要重新摸索的信息存了下来,效率上有改善,推理能力本身没有质变。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。