
你有没有想过,一个能写代码、能解数学题、甚至能通过律师资格考试的AI,如果给它一支笔和一张画布,让它照着一张图临摹,它能画成什么样?
答案可能会让你意外。最新的研究发现,目前最强的多模态大模型,画出来的东西,跟直接把参考图的平均颜色糊在画布上,几乎是一个水平。
这篇来自北京大学、清华大学和商汤科技研究团队的论文,叫做《Paint What You See》,专门测试了25个主流AI模型的绘画能力,结果揭示了一个长期被忽视的短板:这些模型看得懂图片,却画不出图片。
一件被忽略的事:AI很会"看",但不会"动手"
这几年AI agent(智能体)的评测越来越流行,从网页操作到软件开发,从桌面GUI操作到调用各种API,AI已经能在各种数字环境里完成复杂任务了。但研究团队注意到一个共同点:这些任务对精度的要求都很宽松。
比如说GUI操作里点一个按钮,只要点在按钮范围内,无论偏左偏右都算成功。这就是论文里说的"容忍区间"操作,模型不需要精确控制每一个像素,只要落在一个足够宽的区域里就行。
再看那些让AI"看图"的任务,像是视觉搜索、区域标注这些,AI确实要理解图像里的细节,但它们通常只是给出一个理解结果,比如说"这里有只鸟",并不需要真的把这只鸟画出来。真正需要产生视觉内容的活儿,比如说图像编辑、语义分割,往往都是AI发出一个指令,交给专门的生成模型或者分割模型去执行,AI自己并不亲手操作。
论文把这种能力叫做"灵巧视觉工具使用"
灵巧视觉工具使用:指AI需要从视觉画面中读出精细信息,直接转化成控制画笔的具体参数(比如起点坐标、颜色、粗细),这些参数直接决定最终画出来的结果,而且每画一笔都要根据画布的最新状态调整下一笔,形成一个持续的闭环。
这个概念是借用机器人领域"灵巧操作"的说法。机械手抓取一个杯子的时候,它自己的手指动作直接塑造了最终抓握的结果,而不是喊一声"帮我拿杯子"让别的机器代劳。研究者觉得,视觉领域也缺这么一种能力测试:AI必须亲自下场,自己决定笔触的每一个参数,而不是把活儿甩给背后的分割模型或者生成模型。
这就好比让一个美食评论家去后厨掌勺。评论家能精准说出"这道菜盐放多了""火候差了三十秒",这是理解能力。但真让他自己颠勺、调味、控制火候,情况可能完全不同,因为评价和执行需要的是两种不同的本事。如果一直只考评论能力,从不让他真正下厨,那你永远不知道他到底会不会做菜,这恰恰是过去AI评测体系里被忽略的一块。
为什么选择"画画"作为测试题
研究团队设计了一个叫EASEL的评测基准,核心任务是让AI照着参考图,一笔一笔地在空白画布上画出相似的图案。
为什么偏偏选中画画这件事?
论文给出了几个理由。第一,画画这件事天然是闭环的:每画一笔,画布就会变化,AI必须重新观察新的画布状态,决定下一笔怎么画,这正好符合"闭环参数化视觉动作"的定义。第二,画笔参数的误差没有地方可以藏。不像点击按钮有个容忍区域,你笔触的位置偏了、颜色错了、粗细不对,直接就体现在画面上,没有中间商去帮你兜底。第三,这套评测几乎不需要人工标注,参考图可以随便找,AI怎么画的轨迹是自动记录的,非常容易规模化。
具体这个任务是怎么运作的?
在每一步,AI会同时看到两张图:一张是要模仿的参考图R,一张是当前正在画的画布。AI需要输出一个叫brush_stroke的动作指令,这个指令是JSON格式的,包含13个参数:一条二次贝塞尔曲线的起点、控制点、终点坐标(决定笔触的形状和走向),起点和终点各自的半径与透明度(决定笔触粗细和虚实的渐变),以及一组RGB颜色值。系统根据这13个参数把这一笔渲染到画布上,生成新的画布状态,反馈给AI,如此循环往复,直到步数用完。
二次贝塞尔曲线:一种用三个点(起点、控制点、终点)描述的曲线,常用来表示平滑的弧线笔触,比直线更灵活,又比复杂曲线更容易用少量参数控制。
这套测试题一共110个参考图重建样本,覆盖了从简单几何图形、多物体空间布局、卡通/抽象画风到真实自然图像四个难度递增的类别,最难的一档需要128步画笔预算。除此之外还专门设计了5个语义任务:让AI描出圆形轮廓、描出图中苹果的轮廓、手写"hello"这个单词,以及在迷宫里画出一条通路。这些语义任务共享同一套画笔动作接口,但目标从"临摹相似"换成了"完成指令"。
结果打了所有模型一个措手不及
论文给出的成绩单相当扎眼。
先看几个"参照物"。如果你什么都不做,画布保持空白,最终相似度打分是0.446。如果你偷懒,直接把参考图的平均颜色整片糊上去,得分是0.534。而全部25个被测模型里表现最好的Gemini 3.1 Pro,最终得分是0.535,跟"随便糊一片平均色"基本打平。
这里说的相似度打分,是论文自定义的一个综合指标:
相似度指标:由三部分加权组成,结构相似性SSIM占50%权重(衡量整体轮廓和布局是否像),RGB颜色误差占30%权重(衡量颜色是否准),边缘IoU占20%权重(衡量物体边界画得准不准)。
但如果只看"随便糊色"和Gemini的对比,你可能会觉得这个指标不太公平,糊色和真画怎么能得分差不多?这里有个关键细节:糊一片纯色,边缘IoU(边界重合度)永远是0,因为压根没有边界可言。而Gemini好歹能画出0.053的边缘IoU,说明它多少捕捉到了一点结构信息。真正让人意外的是这个差距太小了,说明当前最强的AI,画出来的边界结构信息量少得可怜。
再看一个更硬核的对照组:论文里用了一个叫"数据策略"的传统神经绘画算法(不是大模型,是专门训练来画画的老派模型),在预算对齐的设置下能拿到0.665分,在原生250步设置下能到0.715分,边缘IoU分别是0.281和0.563。这就是说,画画这件事本身并非无解的难题,一个专用的小模型都能大幅超越通用大模型好几个身位。这个跨度从0(纯色糊图)到0.053(Gemini)再到0.281-0.563(专用模型),说明这个评测指标本身是有足够区分度的,不是天花板太低导致大家都考不出成绩,而是AI真的没画好。
开源模型的表现更加扎堆,普遍聚集在0.40到0.45分之间,模型参数量从4B到90B都有,但分数几乎看不出规律,参数越大不代表画得越好。
论文特意训练了一个叫EASEL-9B的模型(基于Qwen3.5-9B用绘画轨迹数据微调),最终拿到0.459分,排在全部25个模型里的第三名,是开源模型里最高分,比它的基础模型Qwen3.5-9B(0.432分)相对提升了6.3%。
两种"画不下去"的毛病:躺平和瞎画
比起最终分数,论文里对绘画过程的分析更有意思。研究者记录了整个作画过程中每一步的相似度变化,发现了两种截然不同的失败模式。
第一种是"早早躺平型"。Gemini 3.1 Pro、Claude Opus 4.7、Claude Sonnet 4.6 这几个头部模型,在最开始的5%步数里相似度快速上升,之后就几乎不再变化了。论文给出了几个诊断指标来量化这个现象:
轨迹诊断指标:包括"50%进度时的相似度"、"轨迹AUC"(整个过程相似度的平均水平)、"最佳相似度"(过程中出现过的最高分)、"终值-最佳差距"(最终得分比历史最高分低多少)。这些指标合在一起,就是用来判断模型是不是一直在有效利用反馈,还是画着画着就摆烂了。
这几个头部模型的这几项指标数值几乎一模一样,说明它们做完开头几笔之后,剩下的画笔预算基本是在"敷衍了事",画布状态实际上没有再实质性改善。
第二种是"越画越差型"。GPT-5.5、GLM-5V-Turbo、qwen3.5-plus 这几个模型,表现刚好相反:它们全程都在动笔,动作没有停,但轨迹AUC(过程平均分)反而比最终分数高,说明画到后面反而把画布搞坏了。GPT-5.5是最典型的例子,它的"终值-最佳差距"达到0.073,也就是说它历史最高曾经达到0.440分,结果收尾时反而掉到了0.426分。
这就像请两个不同性格的装修工人来刷墙。一种工人刷了两面墙之后觉得"差不多得了",剩下的时间就杵在那儿,工具明明还在手里却不肯再动一下。另一种工人闲不住,刷完之后总觉得哪里不对劲,又忍不住去补几笔,结果手一抖把刚刚刷好的墙给蹭花了。如果工人能一直保持专注,既不半途松懈,也不画蛇添足,那才是真正把"反馈"用到位了。可惜论文里发现,不管是哪个头部模型,都没能做到这一点,效果峰值全都出现在前10%的步数以内,剩下90%的预算,基本上是在浪费。
论文还专门提醒了一个容易被误读的地方:那些"终值-最佳差距"很小的开源模型,看着好像"维持得很好",但其实是因为它们82.3%到92.4%的动作都是原地重复,压根没在画。这跟头部模型那种"选择性保守"的小差距,性质完全不一样,一个是真的在观察画布之后决定不改动,一个是根本没在观察。
语义任务:暴露出更细的能力边界
比起临摹重建,论文里的语义任务反而更能看出模型之间的差距。这些任务不再是"画得像不像",而是"完成没完成指令",包括描圆形轮廓、描苹果轮廓、手写hello、走简单迷宫和走复杂迷宫。
结果很有意思。Gemini 3.1 Pro和GPT-5.5在轮廓标注和手写任务上表现突出,手写"hello"都拿到了满分1.000。但Claude Opus 4.7在描圆形轮廓这个任务上直接得了0分,原因是它陷入了一种"画一笔撤销一笔"的死循环,来回拉扯却从不真正往前推进,导致画布上始终没能积累出一个完整的圆。
这暴露出一个新问题:光会画准还不够,还得"稳得住"。如果一个模型总是自我怀疑,画了又撤,撤了又画,那再强的空间感知能力也没用,因为它压根没法把动作积累成一个完整的结果。
迷宫任务的结果更耐人寻味。GPT-5.5在简单迷宫上拿到了满分1.000,尽管它在临摹重建任务上的表现并不算顶尖,这说明"画得准"和"听得懂指令去规划路径"其实是两种相对独立的能力。而更难的复杂迷宫,所有模型全军覆没,没一个能走通。
论文还记录了各个模型的"撤销"行为模式。Gemini 3.1 Pro和GPT-5.5几乎只在迷宫任务里用撤销操作,这说明它们的撤销是有针对性的,是撞墙之后主动纠错,而不是漫无目的的犹豫。GPT-5.5在简单迷宫任务里撤销了25次之后才提交答案,最终拿到满分,这是整个评测里最典型的一个闭环自我修正案例。
反过来Claude Opus 4.7在迷宫任务里只撤销了3次,但在轮廓和手写任务里却撤销了124次,模式完全反过来,印证了它在非迷宫任务里那种拉扯循环的问题。Claude Sonnet 4.6则是另一种极端,它几乎从不使用撤销,但在迷宫任务里犯了最多的无效动作错误(撞墙率高达93%),这说明它压根没有意识到自己撞墙了,只是自顾自地往前画,是一种"不知道自己错了"的失败模式,跟"知道错了但改不好"是两种完全不同的问题。
给AI喂"画画教材"能提升多少
既然现有模型普遍画不好,研究团队干脆自己动手,构建了一套叫EASEL-Data的训练数据,试试能不能通过喂数据来改善这个能力。
具体做法是先准备了1.1万张参考图,来源包括程序生成的基础几何图形、文字字形、COCO数据集里裁出来的单物体/双物体/多物体图片,还有Tiny ImageNet里的自然图像,覆盖从简单到复杂的视觉难度谱系。
然后,用一个专门训练来画画的"神经绘画策略模型"(不是大语言模型,是专门优化画画效果的强化学习模型),针对每张参考图生成一条250步的画笔轨迹。这条轨迹相当于一份"标准答案示范":给定参考图和当前画布,下一笔该怎么画,都记录下来。
接下来是最关键的一步,把这些轨迹转换成训练样本。研究团队设计了一个"两阶段课程":
两阶段课程训练:C1阶段专门覆盖画作的早期阶段(第0到49笔,其中前16笔全部保留),训练模型学会打底稿、定色调;C2阶段覆盖整条轨迹(第0到249笔),但采样密度递减,训练模型学会中后期的细化完善。
这个设计思路其实很像教小孩学画画。先让孩子反复练习怎么打草稿、定构图、上大色块,把这个基本功练扎实了,再教他怎么在细节上精雕细琢。如果一上来就让孩子同时学两件事,构图和细节混在一起练,反而两头都学不精。这也是为什么论文最后统计发现,C1阶段的训练贡献了绝大部分的分数提升,而追加C2阶段带来的额外提升相对有限。
最终一共生成了44万条"下一步该怎么画"的监督样本,其中10%的参考图还配上了推理模型生成的思维链解释(4.4万条),用来教模型不仅要画对,还要能说出画这一笔的理由。
用这套数据,研究团队对Qwen3.5-9B做了LoRA微调(一种只调整模型部分参数、不用重新训练整个大模型的高效微调方法),结果拿到了0.459分,比只用C1数据训练的版本(0.456分)略高,比原始的Qwen3.5-9B(0.432分)高出0.027分,相对提升6.3%。有意思的是,微调后的模型"终值-最佳差距"反而从0.015略微上升到0.019,这说明模型确实学会了画得更好,但长程反馈修正这个更难的能力,还没有被真正解决。
研究团队还专门检查了训练之后模型的基础视觉理解能力有没有受损,结果显示在MMVP、POPE、HallusionBench等经典多模态感知测试上,EASEL-9B相比基础模型基本持平甚至略有提升,说明这种"教它画画"的训练方式,并没有让模型变笨,反而在某些细粒度感知能力上还有小幅提升。这算是一个意外的好消息,说明画画训练和通用视觉理解之间不是零和博弈的关系。
Q&A
Q1:EASEL是什么?
A:EASEL是一个专门评测多模态AI模型"灵巧视觉工具使用"能力的基准测试,核心任务是让AI照着参考图,一笔一笔在画布上画出相似图案,同时还包含区域标注、手写、迷宫路径规划等语义任务。
Q2:为什么现有的AI模型画画表现这么差?
A:论文发现表现最好的Gemini 3.1 Pro最终得分只有0.535,跟直接用参考图平均颜色糊满画布的分数(0.534)几乎相同,而专门训练的神经绘画模型能拿到0.665到0.715分,说明当前多模态大模型普遍缺乏持续利用视觉反馈进行修正的能力,画几笔后就容易躺平或者越画越差。
Q3:EASEL-9B是怎么训练出来的,效果如何?
A:研究团队构建了440k样本的两阶段课程数据集EASEL-Data,先训练模型学早期打底稿的笔触,再训练中后期细化的笔触,对Qwen3.5-9B做LoRA微调后得到EASEL-9B,最终得分0.459,比基础模型相对提升6.3%,在全部25个评测模型中排名第三,是开源模型里最高分。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。