
先说一个可能反直觉的事实:给一个AI智能体配上更强的"眼睛",它解决复杂问题的能力未必会明显提升;但如果给它配上更强的"脑子",效果立竿见影。
这不是猜测,是有实验数据撑着的。研究团队做了一个很干脆的对照实验:只换掉负责"看"视频、听音频的感知模块,成绩几乎没怎么掉;只换掉负责"想"下一步该干什么的规划模块,成绩直接从八十多分摔到十几分。这个发现,对做多模态智能体的人来说,有点颠覆认知,因为大家一直以为,AI理解视频、音频这些"看和听"的能力才是瓶颈。
问题到底出在哪
想象一下你在帮朋友查一件事:视频里某个网红什么时候第一次发Instagram,得先看视频找到品牌是谁,再去查这个品牌的Instagram注册时间,再查它第一条帖子的时间,最后算出中间隔了几个月。这中间你要处理的信息包括一段啰嗦的视频文本转录、一堆网页搜索结果里夹杂的广告和无关内容、还有你自己脑子里记着的"我已经查到了什么、还差什么"。
现在把这件事交给AI智能体来做。它每一步都会调用工具去获取信息,浏览器返回的是一整页夹杂着噪声的文本,视频理解模块吐出来的是一大段描述,里面掺杂着一堆无关细节。这些东西全都会被塞进对话历史里,一轮一轮往上堆。等到第十步、第二十步的时候,AI要在这堆越来越长、越来越乱的文字里,重新翻出"我到底还差什么信息",这跟你在一堆便利贴里找一张三天前写的关键笔记没什么两样。
这篇论文的作者们把这个问题定位得很清楚:多模态智能体的核心瓶颈不是感知能力不够,而是规划能力跟不上。他们提出了一个系统,叫做Omni-Decision,专门解决这个"越问越糊涂"的问题。
反事实实验:换掉规划器 vs 换掉感知器
研究团队做了一组控制变量实验,把系统里的两个核心部件分别单独替换,一个是负责决策的规划器,一个是负责看视频、听音频的感知后端,观察准确率的变化。
结果很扎眼。把规划器从GPT-5.2换成参数量小得多的Qwen3-Omni-30B,整体准确率从81.39%直接掉到14.72%,跌了66个百分点。而把感知模块从Gemini-3.1-Pro换成三种不同的替代方案,成绩最差也还能保持在58.89%,跌幅不到23个百分点。同一代模型内部做对比,替换Qwen3.5-Plus这个规划器要付出23.3分的代价,替换同一档位的感知模块只要付出15.8分,比例大概是1.5比1。
更有意思的是,一旦规划器弱到一定程度,感知质量再好也没用了。同时替换两个部件,成绩是13.89%,跟单独换掉规划器的14.72%几乎一样。这说明感知模块此时已经不是瓶颈,规划能力差到一定程度,给它再清晰的观察结果也白搭,它已经没有能力把这些信息组织起来去推进任务了。
这个发现直接决定了整篇论文的设计方向:与其继续死磕感知精度,不如去修规划这条腿。
证据账本:把"记忆"变成"记录"
Omni-Decision的核心创新叫做证据账本规划
证据账本:一个结构化的、随任务动态更新的状态记录表,记录当前还缺哪些证据、已经确认了哪些事实、哪些地方出现了矛盾。
传统做法是把每一次工具调用的返回结果原样塞进对话历史,让AI自己在这堆文字里找线索。Omni-Decision换了个思路:不让噪声进入AI要反复阅读的持久上下文,而是设一个"账本",每次工具返回结果,先经过一个"审核员"角色过滤和提炼,只把有用的部分写进账本,原始的噪声内容看一眼就扔掉。
这就像公司报销。如果每个人报销都把整张购物小票原封不动地塞进财务系统,小票上印着商品名、促销广告、会员积分提示、收银员工号,财务人员要从这堆信息里抠出"金额"和"事由"两个字段,效率会越来越低,而且时间越长,堆积的小票越多,越容易看漏。但如果有个专职审核的人,每张小票进来先审核提取出"金额540元,用于差旅打车",写进一张干净的台账,后面无论谁来查账,看的都是这张台账,不用再翻堆积如山的原始小票。如果不设这道审核关卡,随着任务步数增加,规划器要处理的上下文会线性膨胀,而实验里"不设账本"的对照组(No-ledger ReAct)在中等难度和高难度任务上比完整方法低了24个百分点,恰恰印证了这一点。
账本里具体记什么?论文给出了四个字段。
未解决的证据需求:从问题拆解出来的一张待办清单,比如"确认品牌名称""获取上线日期",每条都标注了是否已经填上。
事实与计算槽位:查询里隐含需要的外部事实、实体属性、计算结果,比如两个日期之间差几个月这种数值。
已确认证据:带来源和时间戳支持的证据原子,是最终答案的直接依据。
未解决冲突:如果不同来源的信息对不上,比如视频里的日期卡只精确到月份,但网页搜索给出了精确到日的日期,这条矛盾会被记进这个字段,并且在解决之前,系统不允许直接给出答案。
这四个字段各自对应一个决策:清单指导下一步该做什么,槽位标出还缺哪些事实和计算,证据支撑最后的回答,冲突则像一道闸门,只要还有没解决的矛盾,答案就出不去。
审核员和写手分开:为什么不能一个人干两件事
论文里还有一个设计细节值得展开讲讲:负责"看观察结果对不对"的角色(critic,姑且叫审核员)和负责"决定下一步做什么"的角色(planner,规划器)是分开的,两个独立的判断。
审核员:读取每一次工具调用返回的原始信息,判断它是支持、还是与已有证据冲突、还是完全没提供有用信息,给出一个"裁决"。
这个设计的道理很直接。如果规划器既要判断刚拿到的这份资料靠不靠谱,又要同时决定下一步干什么,它很容易把两件事搅在一起。研究团队引用了一个已知的现象:大语言模型不太擅长在没有外部反馈的情况下,自己发现并纠正自己的推理错误。也就是说,如果规划器自己一边看资料一边下判断,一旦它把一份不靠谱的网页错误地当成"已经确认的证据",这个错误会一直卡在对话历史里,后面的每一步决策都建立在这个错误基础上,越走越偏,而且没人会去质疑它。
这跟司法系统里为什么要把"证据审查"和"量刑决定"分给不同的人有点像。如果让同一个人既当证人又当法官,他很容易带着自己刚才的证词偏见去做判决,证据本身有没有问题,他自己可能意识不到。把审核这道关卡单独拎出来,交给一个专门角色去把关,出错的概率就明显降低了。数据上,独立审核角色能在提交给账本之前拦截住那些"把噪声页面误判为已确认证据"的错误,不让它污染后续所有决策。
一个具体的执行案例走一遍
论文给了一个真实运行过的案例。问题是:视频里某个品牌第一次发Instagram帖子,距离Instagram平台正式上线,中间隔了多少个月。
系统先把问题拆解成待办清单:品牌是谁、上线日期是多少、第一条帖子日期是多少、月份差是多少。然后依次调用视频定位工具锁定品牌名"Daniel Wellington",调用网页搜索确认Instagram正式上线是2010年10月,第一条帖子发布于2012年7月,最后调用代码执行工具算出准确的月份差是21个月。每完成一步,对应的待办项目就从清单里划掉,同时把支撑证据写进账本。等所有待办项都清空、也没有矛盾冲突了,系统才组织语言给出最终答案21个月。
这个过程有点像装修房子时候的验收清单。水电改造完了打勾,防水做完了打勾,每一项都有明确的完成标志,而不是装修队含糊地说"应该差不多了"。如果没有这张清单,装修队很可能漏掉某一项,等你入住之后才发现某个插座没接电,这就对应到AI系统里"过早收敛""还没查全就给答案"的那类错误。
这套机制不仅指导执行,还能拿来做诊断。研究团队统计了360道题里,账本记录的证据完成度:答对的题目平均完成了66.2%的证据需求,答错的题目平均只完成32.8%。更值得注意的是,92.5%的答错案例其实已经完成了至少一项证据需求,不是完全跑偏,而是最后一环没接上。对这67个错误案例逐一分析原因,发现40.3%卡在媒体感知环节(比如没读清楚画面里的小字),32.8%卡在外部信息检索环节(查到的事实对不上实体),只有4.5%是因为过早停止、没查完就草率收尾。
这个数据本身就很说明问题:有了账本机制、又配上最强规划器之后,决策层面"过早放弃"的问题基本被压下去了,剩下的瓶颈转移到了证据获取本身,也就是感知模块看得够不够细、检索模块查得够不够准。
用运行痕迹反过来训练模型
论文另一个亮点是,这套系统运行时留下的痕迹本身就能变成训练数据,而且不需要人工去一步步标注对错。
具体来说,每一次规划器做决策,系统都会自动记录下当时它看到的账本状态、它选择的动作、以及审核员给出的裁决结果。这些记录被分成两阶段用来训练更弱的规划模型。
第一阶段叫状态监督微调(state-SFT),只保留最终判定为正确的完整运行轨迹,把每一步的"账本状态-动作"拆成一对对训练样本,直接让弱模型模仿强模型在类似账本状态下会做的选择。
第二阶段是闭环对齐的强化学习。因为账本里明确列出了每条待解决的需求,评判一个候选动作好不好,不需要真的把这个动作执行一遍再看结果,只要看它有没有针对性地推进某条待解决需求就行。这大大降低了训练成本,不用每次都跑一整条真实轨迹去拿反馈。
这套训练方案在两个较弱的模型上都见到了效果。Qwen3.5-27B原本只有46.94%的准确率,经过状态监督微调再加强化学习,提升到50.56%。参数量更小的Qwen3-Omni-30B原本只有14.72%,光是做完状态监督微调就提升到18.61%。
这就像老师傅带徒弟。徒弟不用把每次操作失败的机床都重新拆一遍,只要看老师傅当年在类似情况下是怎么调整刀具角度的记录本,照着学就能少走很多弯路。如果没有这份记录本,徒弟只能靠自己反复试错,效率会低得多,而且很可能重复同样的错误。
跑分结果:钱花得更少,成绩还更好
在OmniGAIA这个主打开放世界证据检索的基准测试上(覆盖视频、音频、网页、计算等跨模态问题),Omni-Decision拿到了81.39%的整体准确率,是目前公开报告里最好的成绩。同一时间窗口测试的Gemini-3.1-Pro(谷歌当时最强的模型,直接作答不经过任何智能体框架)是79.44%,也就是说,一套精心设计的智能体系统,配合中等强度的规划模型,居然能小幅超过直接用最强模型硬答。
更实际的一点是成本。按运行时的实际计费记录算,Omni-Decision平均每道题大约1.2美元,而Gemini-3.1-Pro直接作答平均每道题要2.8美元,前者只花了后者大约43%的成本,还拿到了更高的分数。
在另一个专门测长视频理解的基准WorldSense上(这个测试禁用了网页搜索,所有证据都得从视频、音频、字幕里挖),Omni-Decision拿到65.0%,跟当时表现最好的端到端模型Gemini-3.1-Pro(65.5%)基本持平,成本却只要大约0.3美元,是直接作答方式(约0.8美元)的三分之一多一点。
跟其他智能体系统比,差距更明显。一个没有任何控制结构、只是简单给模型开放工具调用权限的极简智能体,成绩只有5.56%。官方基线管线是18.33%。一个多角色协同的系统Orchestra-o1能到72.8%,一个把感知外包给沙箱编码环境的系统能到75.0%,都不如Omni-Decision的81.39%。同样的两个底层模型组合,换不同的"外壳",成绩能从5.56%飙到81.39%,这也再次印证了那个反直觉结论:框架设计对最终表现的影响,可能比换个更强的底层模型还大。
这里就要提一下上下文工程这个方向了。
上下文工程:研究如何组织、压缩、筛选AI智能体处理长任务时积累的信息,让它在有限的注意力窗口里保持高效运转的一整套方法。
此前已经有工作尝试用摘要压缩、占位符替换这些手段来清理堆积的对话历史,但那些方法本质上是"先让噪声进入历史,再事后压缩"。Omni-Decision的做法不一样,它是从源头上不让噪声进入持久记忆,观察结果一进来就被消化成结构化的账本条目,压根不给"越堆越乱"这件事发生的机会。
局限和延伸方向
论文也坦诚了这套系统目前的边界。审核员这个角色目前只处理文本形式的观察结果,原始的视频、音频画面并不会直接进入它的输入,账本的质量因此受限于感知工具输出文本的质量,如果感知模块本身描述得不够细,账本再干净也没用。一个能直接读取多模态输入的审核员,是论文作者认为的下一步方向。
这个局限跟前面的失败归因数据是对得上的:三分之一以上的错误案例卡在感知环节没读清楚细节,这恰好是审核员目前够不着的地方。
站在更远一点的角度看,Omni-Decision解决的其实是一个在很多领域都会反复出现的矛盾:随着任务变长、信息变多,处理这些信息所需要的"注意力"资源是有限的,而信息量是线性甚至指数增长的。把"记忆"变成显式的"记录",让每一次输入都经过审核筛选再进入系统,这套思路不只适用于视频问答智能体,任何需要长时间、多步骤、跨渠道收集信息才能完成的任务,理论上都能借鉴这个设计。
好文章,需要你的鼓励
本文介绍LT-OPD训练框架,通过让极限压缩的多模态大模型在自己生成的内容上接受满血版模型指导,并配合渐进式课程学习,在仅保留5%视觉token时把性能保留率从68.6%提升到82.3%,且不增加推理成本。
本文解读ALIGNOPSD方法,该方法针对AI智能体训练中"决策与时间戳错配"问题,通过先对齐功能相同的决策场景再打分,并按可变长度决策段分配信用,在ALFWorld、WebShop、Search-QA三大任务上相比GRPO提升5.5%至8.7%。
本文介绍自适应一致性图(ACG)方法,通过持久化执行记忆图与预算感知的上下文构建,帮助AI智能体在长任务中减少信息失联,在多项基准测试中相比ReAct等基线方法提升了任务成功率。
多智能体AI协作时重复计算KV缓存浪费严重。PReCache提出预计算低秩缓存和中性基础缓存重构两项设计,免训练实现最高3.1倍加速、2.3倍吞吐提升,且准确率仅比不共享方案低1.1个百分点。