微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 给多模态大模型配一个"P图助手",到底靠不靠谱?

给多模态大模型配一个"P图助手",到底靠不靠谱?

2026-09-22 13:51
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-22 13:51 • 科技行者

你有没有想过,一个AI在回答问题之前,先自己动手把图片改一改,会不会答得更准?

比如你问它:"这张照片里,绿色圆点贴纸后面藏着什么?"

它没法直接看穿贴纸,对吧。但如果它能先把贴纸"抠掉",露出下面的东西,再来回答,是不是就简单多了?

这个想法听起来很美好。事实上过去两年里,学术界一直在往这个方向使劲:让多模态大模型(简称MLLM,就是那种既能看图又能聊天的AI,比如GPT-4V、Gemini这类)先生成一张辅助图片,再拿着这张图去回答问题。这套流程听起来像是给AI装了一双"能P图的手"。

但StepFun和复旦大学的研究团队做了一件挺较真的事:他们没有急着庆祝这个思路多厉害,而是先问了一个更朴素的问题——这双"P图的手",到底在哪些任务上真的好使,哪些任务上纯粹是添乱?

这就是这篇论文的主角,Aphanta。

一个容易被忽略的陷阱

在解释Aphanta之前,得先说清楚这个领域此前踩过的一个坑。

之前很多研究默认了一件事:只要能生成一张"辅助图",多模态模型的表现就会变好。这个假设听起来合情合理,因为人类做题的时候确实喜欢在草稿纸上画一画。

但这里有个致命的漏洞:一张图能不能被正确地"画出来",和这张图对回答问题有没有帮助,其实是两回事。

举个例子,你让AI标出图里所有的橙色五边形,方便数数。AI确实生成了一张带编号的图,看起来专业极了,编号1、2、3一路排到10。可惜漏标了一个,正确答案其实是11个。这张图从"看起来对不对"的角度完全合格,但它悄悄地把错误答案喂给了后续的推理环节。

这就好比你请了一个装修工人来贴瓷砖,工人贴得整整齐齐,色彩搭配也很和谐,唯独墙角少贴了一块。如果你不亲自量一遍尺寸,光看整体效果,你会觉得这活干得漂亮。但漏的那一块恰好就是承重的关键位置。如果不做这种"验收",你永远不知道自己住的房子哪里出了问题,直到某天墙面开裂了才追悔莫及。

这正是Aphanta要解决的问题:它不满足于"生成了一张图"这件事本身,而是要搞清楚这张图到底有没有用,以及如果没用,问题出在哪个环节。

Aphanta的三重对照实验

Aphanta的核心设计其实很直白,就是设置了三种对照条件,让同一个问题被回答三次。

第一种叫直接推理(Direct),也就是A组:不给AI任何辅助图,直接看原图回答问题。这是基准线,代表AI的"裸考"水平。

第二种叫实际编辑(Actual Edit),也就是B组:让AI自己想清楚需要什么样的编辑指令,交给一个图像编辑模型(比如Qwen-Image-Edit这类工具)去执行,生成一张真实的编辑后图片,再拿这张图去回答。这是完整的实战流程,也是大家平时说的"P图助手"模式。

第三种叫参考答案(Reference),也就是C组:研究团队用程序化的方式,人工构造出一张"理想状态"下应该长什么样的图片,直接把这张完美的图给AI看,再让它回答。这张图不是靠AI自己P出来的,而是提前用代码精确画好的标准答案图。

有了这三组数据,就能算出两个关键指标。

一个是编辑增益,也就是B组分数减去A组分数,代表这套"AI自己P图再回答"的完整流程,到底有没有带来实际提升。

另一个是参考增益,也就是C组分数减去A组分数,代表如果有一张完美的辅助图,这个任务本身能不能从中受益。这个指标衡量的是理论上的天花板,和编辑模型做得好不好没有关系。

这两个数字放在一起看,才能真正诊断问题出在哪里。

如果参考增益很高,但编辑增益很低甚至是负的,这说明什么?说明这个任务本身确实需要一张辅助图才能答对,问题在于当前的编辑模型没能把这张图画对。这是一个"执行力不足"的问题,不是"思路错了"的问题。

这就像考试的时候,你知道解这道题需要画一条辅助线,思路完全正确,但手抖了,线画歪了,结果整道题的推导全错了。你不能说"画辅助线"这个策略本身是错的,只能说这次没画准。如果不区分"策略对不对"和"执行准不准"这两件事,你会把一个纯粹的工程问题误判成方法论问题,反而放弃了本该有效的思路。

一个自动化的任务挖掘工厂

光有对照实验框架还不够,研究团队还得回答另一个问题:到底该测试哪些任务?

如果只挑几个AI表现得特别好的任务来展示,那这份报告就变成了一份"广告",而不是一份诚实的诊断书。

所以Aphanta搭建了一条四阶段的自动化流水线,用AI智能体(用的是GPT-5.3-Codex)来批量提出候选任务,人类专家只在关键节点把关质量。

第一阶段是提案筛选。AI智能体根据已有的任务模式,提出新的候选任务,人类审核这个任务在概念上是否可行、能否被量化评估。

第二阶段是初步诊断。用小规模数据快速跑一遍A/B/C三组实验,如果发现这个任务参考增益几乎为零(说明辅助图根本帮不上忙)、或者基线已经接近满分(没有提升空间)、或者编辑模型压根生成不出想要的图,这个任务就会被叫停。

第三阶段是数据构建。对于留下来的任务,团队开始批量收集或合成训练数据,人工审核数据质量和多样性。

第四阶段是训练评估。用构建好的数据训练编辑模型,再跑完整的评测流程,结果会反馈回第一阶段,形成一个持续迭代的闭环。

这套流程最值得称道的地方在于,它把"失败的任务"也完整保留了下来,写进了最终的审计报告里,而不是悄悄删掉。这就好比一个诚实的产品测评,不会只展示成功案例,连翻车的部分也照实记录,这样读者才能看到完整的边界,而不是被精心筛选过的样板房忽悠。

如果只报告成功案例会怎样?读者会误以为"AI辅助P图"是万能药,拿去套用到任何任务上,结果撞得头破血流才发现根本不是这么回事。

20个任务,画出一张能力边界地图

团队一共考察了20个候选任务,覆盖了从底层视觉识别到高阶逻辑推理的各种场景。这20个任务被归到四大类操作。

第一类叫定位(Grounding),意思是找到图里某个特定物体或区域的位置,比如"镜子在哪"、"哪里有产品缺陷"。

第二类叫线索注入(Cue injection),意思是通过标记、圈画、放大等手段,把一个原本很难看清的视觉线索凸显出来,比如"数一数图里有多少个青色菱形"。

第三类叫反事实状态还原(Counterfactual state realization),意思是构造一个和现实不符的假设场景,然后让AI基于这个假设来回答,比如"如果把手表从手腕上摘掉,你还能在图里看到手表吗"。

第四类叫结构化推演(Structured extrapolation),意思是需要严格遵循某种规则或逻辑,精确构造出一个新的图形状态,比如瑞文推理矩阵(Raven's Progressive Matrix,简称RPM,一种经典的图形逻辑推理测试,通常表现为一个3x3的图案矩阵,缺一个格子,要求你从选项里选出符合规律的那个)里补全缺失的图案、或者画一条几何辅助线来解题。

结果发现,这四类任务的表现差异极大。

反事实状态还原是表现最好的一类。经过任务专属优化后,编辑辅助能把下游得分提升0.21到0.37分,这是个相当可观的涨幅。比如"删除手表后还能看见手表吗"这个任务,直接问AI时得分只有0.10,加上编辑辅助之后飙升到0.47,而理论上限(参考条件)是0.92。这说明这类任务确实存在巨大的可挖掘空间,而且当前的编辑模型已经能吃到相当一部分红利。

线索注入类任务同样表现不错。密集计数、七巧板分解、密集差异标记这些任务,编辑辅助都带来了实打实的提升。

定位类任务普遍受益,虽然有时候实际编辑的效果甚至超过了程序构造的参考答案,这恰恰说明参考条件只是一个诊断目标,不是绝对的天花板,AI偶尔能玩出比人工设计更巧妙的花样。

但结构化推演类任务就没那么顺利了。两个RPM变体经过专门优化后确实有所提升,说明"AI完全不懂视觉逻辑"这个说法站不住脚。可电路符号识别、几何辅助线构造、齿轮转动关系、流程图路径判断,这些任务反复出现执行错误。它们往往参考增益是正的,说明理论上有提升空间,但实际编辑的效果却是负的甚至有害,这正是"任务和编辑工具不匹配"的典型信号。

用大白话讲,编辑模型擅长的是"局部加一笔、删一笔、换个颜色"这种操作,一旦涉及到"必须严格满足某种数学或逻辑约束",它就容易露怯。

这就好比让一个手很巧的裁缝去改衣服的尺寸、换个扣子、缝个补丁,他做得又快又好。但如果你让他根据一套复杂的力学公式去设计一件能承重两百公斤的悬挂结构,他大概率会做出一件"看起来像那么回事"但实际上撑不住的东西。手艺再巧,也替代不了对底层规则的精确理解。如果不做这种任务分类,你可能会把裁缝派去干工程师的活,然后怪裁缝不靠谱。

消融和跨模型验证:数字说话

团队把留下来的正向任务资源,整合训练成一个统一的Qwen-Image-Edit模型,在筛选出的正向任务子集上做了完整测评。

结果是,平均任务得分从0.343提升到0.445,绝对提升10.2个百分点,相对提升29.7%。这个数字是在经过筛选的正向任务集合上得到的,不是一份"万能编辑器排行榜",团队反复强调了这一点,避免读者过度解读。

对应的参考分数是0.558,说明即便是经过专门优化的编辑模型,距离理论上限依然有不小的差距,这份差距就是未来继续优化的空间。

团队还试了几个不同的模型组合。Seed-2.0配Seedream-4.5,提升了3.5个百分点;Gemini-3配Nano Banana 2,提升了4.5个百分点;而GPT-5配GPT-Image-1.5,居然是负的5.0个百分点,也就是说加了编辑辅助反而更差了。

这个结果挺有意思的。

如果固定用Qwen3-VL做推理模型,只换编辑器,效果从负4.7分到正10.2分不等,跨度非常大。这说明下游效果高度依赖编辑器本身的执行力,而不只是任务类型决定的。

团队还额外测试了两个不在自己任务库里的外部基准,BabyVision和MIRA,用来检验这套方法能不能推广。结果在BabyVision上,三个测试组合全部是负增益,编辑辅助反而拖了后腿。在MIRA上,只有Gemini-3-Flash配Nano Banana 2这一组合出现了小幅正增益,但三个组合的参考条件全都超过了直接推理。这再次印证了那个核心结论:参考增益普遍存在,说明视觉辅助这个思路本身有价值,但实际编辑能不能兑现这份价值,取决于具体的模型组合和任务类型,不能一概而论。

为什么会出现这样的边界

团队总结出了三条经验规律。

第一条,可靠的视觉状态还原。当需要的编辑操作可以表达为"局部添加、删除、属性修改或者感知线索标记",同时保留场景其他部分不变时,编辑器表现最稳。这类操作本质上是局部的、可逆的、不需要理解全局逻辑关系的。

第二条,看起来对不代表真的对。一张编辑后的图片可能视觉上完全合理、构图协调、光影自然,但同时违反了任务要求的计数、符号对应或几何约束。这是最容易被忽视的陷阱,因为人眼很难一眼看出"漏标了一个"这种细节错误。

第三条,结构化推演不太靠谱。当任务需要精确的符号识别、逻辑严密的构造、或者保持拓扑关系的路径规划时,现有的通用编辑器表现明显不稳定。团队特别强调,这是当前测试的这批通用编辑器的经验边界,不代表扩散模型这条技术路线本身做不到这件事,已经有专门训练的模型在迷宫规划、数独求解这类结构化任务上取得了进展。

三个规律放在一起看,其实指向的是同一件事:通用编辑器目前更像一个手艺精湛但缺乏专业知识的画师,让它画画修修补补没问题,让它精确按图纸施工就容易出岔子。

因果性的边界:这套方法证明了什么,又没证明什么

团队非常坦诚地指出了这套A/B/C对照实验的局限性。

B组的完整流程里,除了返回的编辑图片本身,还多了一次额外的AI推理调用,以及生成编辑指令这个过程本身附带的文字信息。也就是说,即便B组分数比A组高,也不能百分之百确定是"图片内容"起了作用,有可能只是"多想了一遍"或者"编辑指令里的文字描述"本身就提供了足够的信息量。

这正呼应了最近另一些研究发现的现象:有些时候AI调用了工具,但实际上并没有真正使用返回的证据,反而是调用工具前后生成的文字描述本身就已经包含了足够的信息。

团队坦言,要彻底厘清这个因果链条,还需要引入"匹配调用次数但不返回图片"、"用无意义的占位图片"等对照组,这是留给后续研究的功课,Aphanta目前提供的是一张任务级别的实用性地图,而不是一份完整的因果证明。

写在后面

读到这篇论文的时候,最让我意外的其实不是那20个任务本身,而是团队愿意把失败的、被叫停的任务原样留在报告里。这在学术圈其实挺少见的,大部分论文的默认逻辑是"展示我做对的部分",但Aphanta反其道而行之,专门设计了一套机制去记录"这个思路走不通"的证据。

这让我想起一个很朴素的道理:一份地图如果只标出成功的路径,而把死胡同全部抹掉,你走到死胡同的时候只会觉得是自己走错了,不会意识到这条路本来就没有出口。Aphanta把死胡同也画进了地图里,这才是它真正的价值所在,而不是那10.2个百分点的提升数字本身。

还有一个细节挺值得琢磨。GPT-5配GPT-Image-1.5那组实验,编辑辅助反而让效果变差了,掉了5个百分点。这个"负增益"的结果没有被藏起来,而是大大方方地摆在了表格里。这种诚实,恰恰说明了研究团队真正想搞清楚的是"这套方法在什么条件下会失效",而不是"如何把展示效果做得漂亮"。

那么问题来了:当AI越来越擅长自己给自己"打草稿"、自己生成辅助材料来辅助推理时,我们该怎么建立一套机制,让AI自己知道什么时候该信任这份草稿,什么时候该怀疑它?这大概是比"P图P得准不准"更根本的问题。

Q&A

Q1:Aphanta是什么?

A:Aphanta是StepFun和复旦大学团队提出的一套自动化诊断框架,用来判断多模态大模型自己生成的编辑图片,对回答问题到底有没有实际帮助,而不是想当然地认为生成图片就一定有用。

Q2:Aphanta测试的图像编辑辅助方法在哪些任务上最好用?

A:在反事实状态还原(比如删除物体后判断还能否看见)、视觉线索标记(比如密集计数、差异标记)、以及物体定位任务上表现最稳定,能带来明显的分数提升。

Q3:为什么有些任务用了图像编辑反而效果更差?

A:因为编辑模型生成的图片可能"看起来合理"但实际违反了计数、符号对应或几何约束等隐藏要求,尤其在电路图解析、几何辅助线构造、流程图判断这类需要精确结构推演的任务上,编辑模型经常出错,导致错误信息被传递给后续推理环节。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-