微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 南京大学与阿里巴巴联手揭秘:AI绘图大模型中,那些"没用的"格式字符,其实才是真正的幕后操纵者

南京大学与阿里巴巴联手揭秘:AI绘图大模型中,那些"没用的"格式字符,其实才是真正的幕后操纵者

2026-07-31 16:40
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-31 16:40 科技行者

这项由南京大学与阿里巴巴集团联合开展的研究,于2026年7月作为预印本发布,论文编号为arXiv:2607.19139,有兴趣深入阅读的读者可通过该编号查询完整原文。研究团队来自南京大学机器学习与数据挖掘实验室(LAMDA)以及阿里巴巴RTP团队,浙江大学也参与其中。

当你在用AI绘图软件输入"一只红色的苹果",然后等待那张栩栩如生的图片从噪点中慢慢浮现出来的时候,你大概从未想过一个问题:AI到底是通过什么来记住你说的是"苹果"而不是"香蕉"的?最自然的猜测当然是——它一直盯着你输入的那几个字,"苹果"这个词就像一根锚,把整个生成过程牢牢拴在正确的轨道上。

然而,这项研究告诉你,这个直觉是错的。

真正在整个绘图过程中默默维持"我们要画苹果"这一信念的,不是"苹果"这个词,而是一些你从未在意过、甚至根本不知道存在的符号——那些聊天框格式里夹带的结构性字符,比如`<|im_end|>`和`<|im_start|>assistant`。它们就像剧院里的幕后工作人员,从不出现在台前,却悄悄控制着整场演出的走向。

这个发现听起来像个悬疑故事的开头,而整个研究过程,正是一场精心设计的侦探调查。

一、案件起点:AI绘图到底是怎么工作的

要理解这项研究的意义,先得简单了解一下现代AI绘图的基本工作方式。

主流的AI绘图系统(比如研究团队主要分析的Qwen-Image系列模型)并不是把你的文字直接"翻译"成图片。它的工作流程分成两大阶段。第一阶段,一个类似ChatGPT那样的大语言模型(Qwen2.5-VL)先把你的文字描述读进去,把它变成一串数字信号,也就是所谓的"隐藏状态"。第二阶段,另一个专门负责画图的神经网络(叫做扩散变换器,Diffusion Transformer,简称DiT)拿到这串数字信号,从一堆随机噪点出发,一步步把图片"洗"出来。

这里有个细节至关重要。当大语言模型处理你的文字时,它并不是单独处理"一只红色的苹果"这几个字。现代AI助手都有一套"聊天格式"——你的话要被包进一个标准的对话模板里,模板里包含系统说明、用户标识、对话结束标记等等一堆格式符号。以Qwen-Image为例,你输入的提示词会被包装成这样的格式:系统消息说"请详细描述图片的颜色、形状、纹理……",然后是用户消息"一只红色的苹果",然后是结束标记,然后是助手回答的开头标记。

大语言模型把这整段话都读一遍,产生的那些数字信号,被传给绘图模型。但绘图模型只保留其中一部分:你真正说的内容,加上结尾的那几个格式符号(`<|im_end|>`、`<|im_start|>assistant`以及一个换行符)。前面那些系统消息被扔掉了。

研究团队把保留下来的内容分成两类:你实际说的"苹果"这些词,叫做**语义区间**(S);结尾那几个格式符号,叫做**结构区间**(R)。大家普遍的预设是,绘图过程中起关键作用的肯定是S,R不过是个格式残留,没什么用。

这个预设,正是被这项研究彻底推翻的东西。

二、第一个线索:谁在接收最多的"注意力"

研究团队开发了一套专门的分析工具,用来测量绘图过程中不同符号之间的信息流动。在这类神经网络里,每个处理单元(叫做"注意力头")都会分配一定的"注意力"给不同的输入,就像一个人在读一段话时会更聚焦于某些词。通过精确测量这些注意力的分配,研究者可以知道:在绘图的每一步,图片的生成机制到底在"盯着"哪些文字符号。

测量结果令人瞠目。

以最简单的提示词"一个苹果"为例,这个提示词对应2个实际内容词,加上5个结构格式符号。在绘图的整个过程中,图片生成机制对格式符号的关注度,是对"苹果"这个内容词关注度的十倍以上。其中`<|im_end|>`这一个符号,单独吸引的注意力超过了"苹果"一词的六倍。排名最高的那些注意力头,几乎把全部(最高达99.8%)的文字侧注意力都集中在这几个格式符号上,而实际内容词几乎被完全忽略。

也许你会说,"苹果"就两个字,格式符号有五个,数量上就占优势。但研究团队排除了这个解释——他们换算成"每个符号平均受到多少注意力"来比较。即便如此,每个格式符号平均得到的注意力仍然是每个内容词的4到7倍。

接下来,研究团队在三个大规模测试集上验证了这一结论,涵盖从简单到极其复杂的提示词(平均内容词从2个到82个不等),还包括中文提示词。无论提示词多复杂、多长,格式符号每个词平均受到的关注度始终保持在内容词的六七倍以上。复杂提示词因为内容词数量多,格式符号在总量上的绝对优势会下降,但每个词的相对优势反而还会上升。这个现象被研究团队称为"注意力汇聚"(Attention Sink)——格式符号像一个黑洞,把大量注意力都吸引过来,但按照传统理解,它们根本不含有任何与"苹果"相关的信息。

三、第二个线索:格式符号知道"画什么"吗

发现格式符号吸引了大量注意力还不够。一个更关键的问题是:它们是否真的参与决定了最终画什么?还是说它们只是个摆设,就像一个看起来很忙但其实什么都不做的员工?

研究团队设计了两个精巧的实验来回答这个问题。

第一个实验叫做"跨提示词替换"。研究者同时准备了两组提示词,比如提示词A是"一辆红色汽车",提示词B是"一辆蓝色自行车"。正常情况下,A生成红色汽车,B生成蓝色自行车。现在,研究者把A的格式符号部分替换成B的格式符号(因为格式是固定模板,两者经过大语言模型处理后,同一位置的格式符号的数字表示会略有差异)。如果格式符号携带了语义信息,那么换上B的格式符号后,A应该会向蓝色自行车的方向偏移。

实验结果是:几乎没有变化。换上B的格式符号的A,仍然生成了红色汽车,只有一些与提示词内容无关的细节(比如背景或光线)发生了轻微变化。图像相似度测量显示,替换前后的图片高度相似。

第二个实验更进一步。研究者从100个不同提示词里各取出格式符号,把它们平均成一个"万能格式符号"——这个万能版本与任何具体提示词都没有关联,纯粹是格式部分的平均值。然后把这个万能格式符号塞进40个新提示词里,看会发生什么。

结果显示,绝大多数情况下,画出来的还是正确的对象。"一个苹果"配上万能格式符号,仍然能画出苹果。这说明格式符号本身携带的语义信息极其微弱,几乎可以忽略不计。

但偶尔会出现有趣的例外:一小部分提示词换上万能格式符号后,画出的对象变了,有时候甚至变成了一张人脸肖像。研究者发现,把画面引导强度(CFG,一种控制AI"严格遵循提示词"程度的参数)调高之后,这些偏差基本都消失了,画面回归到正确内容。这说明格式符号的语义承载力非常脆弱——在强引导下,真正的内容词能压制它;而在弱引导下,它偶尔会把画面拉向一个"默认状态"(也就是训练数据里最常见的内容,恰好是人脸)。研究者进一步证实,出现这个人脸默认输出,和格式符号里是否含有"一张照片"("a photo of")这样的前缀毫无关系——把这个前缀去掉重新实验,结果一模一样。这说明偏向人脸纯粹是模型的无条件默认,与格式符号的具体内容无关。

由此,研究者得出了一个看似矛盾的结论:格式符号在大语言模型的输出阶段几乎不含有语义信息,但在绘图过程中却受到了极大的关注。那么,绘图模型是从格式符号那里读取什么信息呢?

四、核心揭秘:信息的秘密传递路线

为了弄清楚格式符号在绘图过程中到底扮演了什么角色,研究团队设计了两类更深入的实验,最终拼出了信息流动的完整路线图。

第一类实验叫做"跨轨迹头部移植"。理解这个实验需要先知道,绘图模型由大量叫做"注意力头"的处理单元组成(Qwen-Image模型共有1440个这样的头)。每个注意力头都有自己的一套处理参数,决定了它如何分配关注、如何提取信息。

研究者同时运行两个绘图过程,一个画苹果(轨迹A),一个画香蕉(轨迹B)。然后,他们逐渐把轨迹B里某些注意力头的参数"移植"到轨迹A里,看什么时候苹果会变成香蕉。

关键在于移植的顺序。按照传统认知,"最重要的头"应该是那些最努力读取内容词("苹果""香蕉")的头。所以研究者首先测试:按照"对内容词的关注度从高到低"的顺序移植,是不是很快就能把苹果变成香蕉?

实验结果给了一记耳光。按这个顺序移植时,换了很多头之后,苹果不但没变成香蕉,反而开始出现人脸——那个我们熟悉的"无条件默认输出"。也就是说,那些最积极读取"苹果"这个词的注意力头,对于"到底画苹果还是香蕉"这件事,其实没什么决定性作用。

真正决定对象身份的,恰恰是那些对内容词关注度最低的头——也就是那些把注意力几乎全部集中在格式符号上的头。按照"对内容词的关注度从低到高"的顺序移植时,只需要换掉全部1440个头中的18%,苹果就干净利落地变成了香蕉。

这说明:负责"记住我们要画什么"的,正是那些看起来只盯着格式符号的注意力头。格式符号不只是注意力汇聚的终点,它们是整个绘图过程中物体身份的真正存储地点——研究团队把这个角色称为"隐式语义寄存器"。

第二类实验用来追查格式符号是怎么知道"要画苹果"的。研究团队设计了一个"注意力遮蔽"实验:在绘图过程中,分别切断格式符号与不同信息来源之间的联系,然后观察图片发生了什么变化。

第一种切断:阻止格式符号"看"内容词(比如"苹果"这个词)。结果:苹果还是画出来了,几乎没有变化。这说明格式符号不是通过直接读取内容词来获得"苹果"这个信息的。

第二种切断:阻止格式符号"看"图像潜变量(也就是那些正在逐步从噪点变成图片的中间产物)。结果:仅仅遮蔽前两个处理层之后,苹果就消失了,画面彻底崩溃。这说明格式符号是通过读取图像的中间状态来获知"要画苹果"这个信息的。

把两个实验结合起来,信息的传递路线就清晰了:内容词("苹果")在绘图过程的最早阶段(第一个处理层内)把信息注入图像潜变量,图像潜变量带着"苹果"这个概念开始演变;格式符号则通过持续读取图像潜变量,把这个概念吸收进来,然后在整个绘图过程中扮演"语义维持者"的角色,确保生成不偏离"苹果"这个目标。

换句话说,内容词是"播种者",在绘图一开始就把种子撒进图像里,然后退场;格式符号则是"看守者",通过持续监视图像的生长状态来维持种子的方向。真正的语义信息,从始至终都没有从内容词直接传递给格式符号,而是绕了一个大弯:内容词→图像→格式符号。

五、从发现到应用:一条意外的提速之路

弄清楚了格式符号和内容词在注意力层面的不同角色之后,研究团队发现了一个非常实用的推论:那些最努力读取内容词的注意力头,在决定"画什么"这件事上是无关紧要的。那么,把它们关掉会怎样?

研究者据此设计了一个"免训练头部剪枝"方案。具体做法是:按照每个注意力头对内容词的关注度从高到低排序,然后在绘图过程的后80%阶段(前20%保持不动,因为早期阶段负责确定物体身份,更敏感)关掉排名靠前的那些头的计算。

测试结果在GenEval(一个专门测量文生图模型"画对了什么"的标准测试集,包含553个提示词)上显示,关掉360个头(占1440个的25%)之后,注意力计算量减少了20%,而测试得分只从76.1分降到74.7分,下降了1.4分。对象的正确性得到了很好的保留,代价只是一些视觉质量的轻微下降。

更有意思的是对比实验:如果改成关掉那些对格式符号关注度最高的头(也就是我们说的"语义寄存器头"),在同样的数量下,测试得分暴跌到69.6分,损失巨大。如果随机选择要关掉的头,得分更是崩溃到51.3分。这个对比有力地证明,两类注意力头的功能确实截然不同——关掉"读内容词"的头几乎无害,关掉"格式寄存器"的头则灾难性。

这套剪枝方案的另一个优点是不需要针对每个提示词单独计算,可以在所有提示词上通用,实现起来非常方便。

六、更宏观的发现:绘图模型的"分工体系"

除了格式符号的特殊角色,研究还进一步揭示了整个绘图模型内部的组织方式,包括注意力头之间的分工和不同深度层的分工。

在注意力头的分工上,研究发现全部1440个头大致可以分成两类。第一类是"语义头",也就是那些把注意力集中在格式符号上的头,它们负责存储和维持"要画什么"的信息,是物体身份的持有者。第二类是"渲染头",它们几乎把全部注意力放在图像本身的各个部分之间,对格式符号和内容词都不太感兴趣。渲染头负责把图像各个局部拼合成空间上连贯的整体图像。研究者发现,只要关掉一小部分渲染头,整张图片就会立刻崩溃成一片混乱的色块,而不是某个局部变形——这说明渲染头对视觉质量至关重要,但并不是对象识别的关键。

在不同深度层的分工上,研究者聚焦于最能有效传递对象身份的约270个注意力头,分析它们在60个处理层中的分布。结果显示,这些头高度集中在两端:早期的第1至10层有89个,晚期的第51至60层有85个,而中间的第11至50层只有零星分布的96个。

把三个层段分别独立测试,可以得到一幅清晰的分工图:早期层(第1至10层)是对象身份的"确认者"——单独替换早期层的头,就能干净地把苹果变成香蕉,这与之前发现的"内容词在第一层就完成信息注入"相一致;中期层(第11至50层)是"传递者"——单独替换中期层的头,画面几乎没有变化,说明它们的主要工作是把早期建立的身份信息稳定地向后传递,不做决策;晚期层(第51至60层)是"精修者"——单独替换晚期层的头,对象会改变,但伴随着一定的视觉失真,说明它们在修缮细节的同时也还在处理身份信息。

这种"早期确认、中期传递、晚期精修"的三阶段组织方式,与研究者在大语言模型中观察到的信息处理规律高度相似,意味着这可能是一种深层的、跨任务跨模态的普遍计算原则。

七、这套发现在其他模型上也成立吗

为了确保结论不只适用于一个特定模型,研究团队把同样的分析扩展到了另外两个完全不同架构的大型绘图模型:FLUX.2和Krea-2-Turbo。

FLUX.2是一个320亿参数的模型,使用Mistral-3作为文字编码器,格式模板与Qwen-Image完全不同。然而,同样的"格式符号汇聚"现象照样出现:33个格式符号吸走了92%的图像侧文字注意力,每个格式符号平均吸引的注意力是每个内容词的3.3倍,在99.8%的处理位置上,格式符号整体的注意力超过了内容词整体。唯一的差异是主导符号从`<|im_end|>`变成了模板里的系统消息块中的某些词,但这些词同样是格式模板的一部分,与用户提示词的内容无关。

Krea-2-Turbo是一个120亿参数的模型,架构也与Qwen-Image不同(单流而非双流)。这里同样发现:格式符号吸走了67%的图像侧文字注意力,每个符号的平均关注度是内容词的3.1倍,77%的处理位置上格式符号整体占优。

两个模型上的"跨轨迹头部移植"实验,也都复现了Qwen-Image上观察到的规律:按照"读内容词多"的顺序移植头,无法有效转移对象身份;按反向顺序移植,只需移植一小部分就能完成转换。

研究团队还测试了两种极端情况:两步蒸馏版本(把原本50步的生成过程压缩成2步,极大改变了计算动态)和图像编辑版模型(输入除了文字提示词,还包括一张参考图像的视觉表示)。在蒸馏模型上,格式符号仍然吸走了77%的图像侧文字注意力,数字几乎与未蒸馏版本一致。在编辑模型上,即便面对比普通文字提示词信息量丰富得多的视觉输入,每个格式符号平均吸引的注意力仍然是每个视觉符号的7.7倍、每个指令词的13.8倍、每个参考图像潜变量的194倍,格式符号在100%的情况下是整个条件输入中每符号注意力最高的。

这一系列跨模型验证表明,格式符号作为隐式语义寄存器的现象,并不是某个特定模型的偶然产物,而是现代使用大语言模型进行文字编码的绘图模型的一种普遍内在特征。

归根结底,这项研究颠覆了一个我们几乎从未质疑过的直觉:在AI绘图过程中,"说出来的词"和"被记住的概念"之间,存在一个出人意料的分离。你说的"苹果",在绘图的第一步就完成了使命,把信息注入了图像的初始状态,然后就功成身退了。真正从头到尾守护着"画苹果"这一任务的,是几个你从未注意过的格式字符。

这种反直觉的信息处理方式提醒我们,神经网络内部的信息流动远比表面看起来复杂。那些看上去"没用"的部分,往往承担着我们意想不到的关键职能。对于想要优化AI绘图系统的工程师来说,这意味着不能简单地根据"一个输入是不是有语义"来判断它是否可以被删除或简化。对于想要理解AI"思考方式"的研究者来说,这意味着表面上的注意力分配和实际上的功能贡献之间,存在一条需要被仔细辨认的鸿沟。

这项研究还留下了一个开放问题:为什么这些格式符号会演化成语义寄存器?是训练数据的某种统计规律造成的,还是这类架构的某种计算必然性?研究团队坦承这一问题尚未解答,留待未来继续探索。有兴趣深入了解这项研究全部细节的读者,可以通过arXiv:2607.19139查阅完整论文。

---

Q&A

Q1:AI绘图模型中的"注意力汇聚"(Attention Sink)是什么意思?

A:注意力汇聚是指神经网络在处理信息时,把大量"关注度"集中到某几个位置上,哪怕这些位置本身并不含有明显的有用信息。这就像在一个嘈杂的会议室里,所有人都习惯性地看向某个角落,即使那个角落什么都没有。在AI绘图模型中,格式字符(如`<|im_end|>`)就充当了这样的角色,吸引了绘图过程中绝大部分来自图像侧的注意力。

Q2:为什么关掉"读内容词最多"的注意力头对绘图效果几乎没影响?

A:这是因为这些注意力头虽然大量读取"苹果"等内容词,但并不是决定"画什么对象"的关键。真正维持对象身份的是那些集中关注格式符号的注意力头。好比一家公司里,负责接待客户、说话最多的前台,未必是真正决定公司业务方向的人;而那些默默坐在后台操作系统的工程师,才是核心。因此,关掉"话最多"的头,对最终结果影响极小。

Q3:格式符号作为语义寄存器的发现,对普通用户使用AI绘图工具有什么实际影响?

A:短期内,这个发现不会直接改变用户的操作体验,但它为工程师优化AI绘图速度提供了科学依据。研究证明,可以安全地关掉约四分之一的注意力计算单元,节省20%的计算量,同时图片质量几乎不变。从长远来看,理解了信息在绘图模型内部的真实流动路径,开发者可以更精准地设计和调试模型,比如特意加强格式符号的语义承载能力,或者设计更高效的提示词格式,从而让AI绘图更快、更准确地理解用户意图。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-