微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 复旦大学与字节跳动联手打造:一个AI模型,同时看懂图片、画图、改图,它是怎么做到的?

复旦大学与字节跳动联手打造:一个AI模型,同时看懂图片、画图、改图,它是怎么做到的?

2026-06-16 17:19
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-16 17:19 科技行者

这项由复旦大学可信具身智能研究院、字节跳动TikTok及字节跳动Seed联合完成的研究,以预印本形式于2026年6月发布在arXiv平台,论文编号为arXiv:2606.11188。有兴趣深入了解的读者可以通过该编号查询完整论文。

**一个脑子干三件事,听起来很难**

手机里有不少AI应用:有的专门帮你"看图说话"(告诉你照片里有什么),有的专门根据文字描述"画图",还有的专门帮你"修图"(按照你的指令改变图片内容)。这三件事单独做,各自都有不错的AI工具。但一直以来,让同一个AI模型同时干好这三件事,是一个极难攻克的难题。

难在哪儿?核心矛盾在于,"看图说话"和"画图"这两件事,对图片信息的需求截然不同。"看图说话"更在意图片里的高层语义——这张照片里有一只猫,猫是橘色的,它在睡觉。这类信息高度抽象,关注的是"是什么"。而"画图"或"改图"则截然不同,它需要保留图片里每一根毛发的纹理、每一块阴影的渐变——它关注的是"长什么样"的极细致视觉细节。就好比你想让同一个人既当一名精通语言的文学评论家,又当一名能复刻出每一笔笔触的画家,这两种技能的训练方向从一开始就是背道而驰的。

现有的大多数AI模型选择了一个妥协方案:用两套不同的"眼睛"(视觉编码器)来处理图像——一套负责语义理解,一套负责生成细节。这虽然可行,但代价不小:系统变得臃肿复杂,模型需要额外消耗大量算力去协调这两套截然不同的内部语言,推理速度也因此变慢。更糟糕的是,当AI要处理一张已有的图片并对其进行修改时,它需要同时调用两套系统,计算成本急剧攀升。

复旦大学与字节跳动的研究团队决定从根源上解决这个矛盾。他们提出了一个叫做**ARM**(AutoRegressive large Multimodal Model,自回归大型多模态模型)的系统,核心思路是:训练一种全新的"通用图像语言",让同一套符号系统既能表达高层语义,又能保留底层视觉细节,从而让一个统一的AI大脑同时胜任理解、生成和编辑三项任务。

**一、给图片发明一套"通用文字":统一离散视觉分词器**

要理解ARM的核心创新,可以用一个生活中的比喻来切入。普通文字是由一个个汉字或字母组成的——"苹果"这两个字,既能让你想到那个红红的水果(语义),又因为笔画的形状而带有一定的视觉信息(尽管很有限)。ARM的研究团队试图为图片创造一套类似的"文字系统":把一张图片切割成一块块小方块,然后把每块小方块转换成一个"视觉词"(离散视觉token),这些"词"组合在一起就代表了整张图片。

以往用来"画图"的AI所使用的视觉词,就像是摄影师的底片——细节丰富,但如果你不去冲洗出来看,很难说清楚底片上画的是猫还是狗。而用来"看图说话"的AI所使用的视觉词,则像是图书管理员打上的标签——"猫:橘色:睡姿",语义明确,但完全看不出猫毛的质感。ARM需要一种两者兼备的词汇系统。

为了训练出这套"通用视觉文字",研究团队设计了一个精妙的多目标训练框架,同时用四种不同的"老师"来监督这套词汇系统的学习。第一位老师负责"语言对齐":把图片转换成视觉词之后,用一个预训练好的语言模型来对这些视觉词进行图像描述,如果描述得准确(即训练损失函数L_cap低),说明这些视觉词成功保留了语义信息。第二位老师负责"像素重建":把视觉词还原回图片,然后计算还原出的图片与原图在像素级别的差异(即重建损失L_pix),确保视觉细节没有在编码过程中丢失。第三位老师负责"跨模态对齐":利用一种叫做Sigmoid对比损失(L_sig)的技术,让图片的视觉词与对应文字描述的语义向量尽可能靠近,而与其他图片的文字描述保持距离。第四位老师负责"特征蒸馏":直接要求视觉词与一个已经训练得非常好的视觉编码器SigLIP2所产生的原始特征保持相似(L_feat),相当于让学生直接向优秀前辈学习精髓。

这四位老师同时上课,会不会相互矛盾?研究团队做了详细的消融实验,发现两者之间确实存在微妙的张力,但最终的平衡点令人满意。有趣的是,单独使用"像素重建"和"语言对齐"两个目标时,视觉词的语义区分能力几乎为零——在ImageNet图像分类测试中,零样本准确率仅有0.2%,几乎相当于瞎猜。加入"跨模态对齐"目标后,准确率跃升至79.4%,但重建质量(用PSNR指标衡量)反而略有下降,原因在于过于强调语义聚类会牺牲一些有助于像素重建的细微视觉变化。而"特征蒸馏"目标则在保持较高语义准确率(58.1%)的同时,显著提升了重建质量。最终,四个目标协同训练的结果是,语义准确率达到80.2%,重建质量也达到四种配置中的最高水平,词汇表的利用率和多样性(用codebook usage和perplexity衡量)也均达到最优。

在技术实现上,这套视觉词汇系统基于一个已预训练的强力视觉编码器SigLIP2-SO400M-512构建,该编码器在训练过程中保持冻结,以稳定优化方向。图像经过编码后,通过若干注意力模块投影到一个紧凑的潜在空间,再由一种叫做有限标量量化(FSQ)的技术将连续向量转换为离散的整数编码。这种量化方式不需要维护一个显式的"词典本",却能支持高达65536个不同的视觉词,表达能力非常强。量化之后,再通过一个对称的投影模块将词汇还原回原始特征维度,为后续任务所用。

将视觉词还原成真实图片,则依赖于一个独立的"渲染器"——一个基于FLUX.1[Dev]预训练的潜在扩散模型(Latent Diffusion Model)。研究人员用训练好的视觉词作为条件,将这个扩散模型的文本条件替换为视觉词,使其学会从视觉词直接"渲染"出高质量图片。这个设计还带来了一个令人惊喜的副产品:研究团队发现,换成一个较小的扩散解码器(Sana1.5-1.6B)时,两者生成的图片在全局构图、物体形状乃至大量细节上都高度相似,差异主要体现在人脸细节、文字清晰度和纹理精度上。这意味着视觉词本身已经携带了大量高质量的视觉信息,扩散解码器更多扮演的是"精细上色"而非"构思创作"的角色。

**二、一本"读万卷书"的大模型:大规模自回归多模态训练**

有了这套通用视觉语言,研究团队便可以把图片和文字统一转换成一串串"词"(无论是中文字符还是视觉词),然后训练一个大型语言模型来学习这些词的规律——就像语言模型通过阅读海量文本来学会写作一样。

ARM的基础大模型从Qwen2.5-7B(一个拥有70亿参数的语言模型)出发,在原有的文字词汇基础上额外添加了一层线性变换层,用来预测视觉词。训练数据涵盖了五大类别,共同构成了一个海量的多模态知识库。纯文字数据覆盖了通用语言、数学推理和代码等高质量文本,为模型打下跨模态推理的语言基础。图像转文字数据来自大规模网页图文对,包含OCR文档、图表和空间标注,帮助模型学会"读图"。文字转图像数据则是精心筛选的高质量图文对,辅以现有图像生成模型产出的合成样本,以扩展风格覆盖。交错多模态数据来自视频序列和网页文档,使模型能够理解长篇幅、多图文交织的内容,也用于训练图像编辑能力。

整个大模型的训练分为四个阶段循序渐进。预训练阶段,模型在2.5万亿个多模态词元上进行训练,图像以原始分辨率处理(最高512×512用于生成任务,最高980像素用于编辑任务)。持续训练阶段,继续用2.5万亿词元训练,提升图像分辨率至最高1024像素,同时增大交错数据的比例,让模型的多步推理能力得到强化。监督微调阶段,用2000亿词元的高质量指令跟随数据集精调,进一步增强模型在对话和指令理解场景下的表现。整个训练过程耗用了大量GPU资源,仅预训练阶段就使用了200块GPU,持续训练阶段使用了160块。

ARM还支持动态分辨率的图像生成和编辑,实现方式相当简洁:在文字指令中插入"形状词元",明确告诉模型目标图片的高和宽应该是多少个词元格子,这样模型就能自适应地生成不同比例的图片,而无需针对每种分辨率单独训练。

**三、从"能用"到"好用":用强化学习对齐人类偏好**

经过大规模训练的ARM已经具备了相当的理解、生成和编辑能力。但就像一个技术扎实却还不够"懂人心"的画家,它生成的图片可能在技术上是对的,却不够符合用户真正想要的效果——比如画面中物体的位置关系不够准确,或者编辑时改动了不该改的区域。

为了解决这个"知道怎么做但做得不够好"的问题,研究团队引入了强化学习(RL),具体采用了一种叫做分组相对策略优化(GRPO)的方法。这个思路可以用一个考试打分的比喻来理解:每次给模型一个题目(文字指令),模型会生成16张候选图片,然后由"裁判"(GPT-o3或GPT-4.1)对每张图片打分,评分维度包括视觉质量、指令执行的准确性和修改区域的一致性。分数高的图片被认为是好的"答题方式",模型通过不断练习这种"出题—答题—打分—改进"的循环,逐渐学会更符合人类偏好的生成方式。

强化学习训练分三个阶段进行,逐步叠加。首先单独对文字转图像任务进行强化学习训练(T2I RL),之后再单独对图像编辑任务进行强化学习训练(Edit RL),最后进行联合强化学习训练(Joint RL)。

这个过程带来了一个出人意料的发现:针对文字转图像优化的训练,不仅让生成质量变好,还悄悄地提升了图像编辑能力。反过来,针对编辑任务的优化,也小幅提升了纯粹的图像生成分数。研究团队将这种现象称为"跨任务协同效应"——因为两项任务共用同一套视觉词汇和同一个AI大脑,优化其中一项任务等于在共享的表示空间上做出改进,而这种改进会自然而然地惠及另一项任务。更重要的是,整个强化学习过程中,模型在图像理解任务上的表现始终保持稳定,没有出现"为了生成能力而牺牲理解能力"的跷跷板效应。这表明,在离散视觉词的框架下,对生成任务的偏好优化并不会干扰模型已经学会的视觉理解能力。

**四、考试成绩单:ARM在各项基准上的表现**

评估一个声称"全能"的AI模型,需要在多个维度的"考场"上同时交出成绩单。

在图像理解方面,ARM在多个标准测试集上与那些专门针对理解任务优化的模型相比毫不逊色。在POPE(评估模型是否会把图片中不存在的东西说成存在)测试中达到87.3分,在MMMU(需要博士级别多学科知识的综合理解测试)上达到40.2分。对比来看,使用同样离散视觉词的前代模型Emu3在MMMU上只有31.6分,POPE只有85.2分——ARM的离散视觉词设计在不牺牲理解能力方面迈出了重要一步。尽管ARM在某些测试上仍略低于使用连续视觉表示的专用理解模型(如Bagel在MMMU上达到55.3分),但它是在同时支持生成和编辑任务的前提下取得的,这已经非常有竞争力。

在图像生成方面,ARM在GenEval测试集(评估生成图片中物体数量、属性、空间关系的准确性)上整体得分0.79,经过强化学习后提升到0.86,超过了Janus-Pro-7B(0.80)。在DPG测试集(评估生成图片与复杂文字描述的全局语义对齐程度)上,ARM的整体得分84.48,强化学习后达到86.00,与DALL-E-3(83.50)和FLUX.1[Dev](83.84)等知名扩散模型相比完全处于同一水平线上。在WISE测试集(专门评估需要世界常识才能正确生成的图片,例如"正确画出太阳系行星的相对位置")上,ARM基线版本得分0.50,强化学习后达到0.56,超过了FLUX.1[Dev](0.50)和BAGEL(0.52),在时间和空间类别的子项目中表现尤为突出。

在图像编辑方面,ARM在GEdit-Bench测试集(用GPT-4.1评估编辑效果,包括语义一致性、感知质量和综合得分三个维度)上,基线版本的综合得分(G_O)为5.75,强化学习后跃升至6.68,与顶级专用编辑模型Step1X-Edit(6.70)并驾齐驱,远超早期的InstructPix2Pix(3.68)和OmniGen(5.06)。值得关注的是,ARM在感知质量(G_PQ)维度上达到了7.67分和7.68分,在所有对比模型中名列前茅,表明其输出的图片在视觉质感上尤为出色。

**五、一个有趣的发现:语义词汇让AI不再依赖"辅助导航"**

在图像生成领域,有一种常见的技巧叫做"无分类器引导"(Classifier-Free Guidance,CFG)。通俗地说,这就像是在AI生成图片的过程中给它安装了一套"导航系统":AI会同时生成一张"有文字提示条件的图片"和一张"完全随机的图片",然后刻意往"有提示"方向倾斜,以确保生成结果更贴近文字描述。代价是每生成一张图片需要做两次前向计算,速度减半。

研究团队发现,基于语义视觉词训练的ARM,在关闭这套"导航系统"后,依然能生成视觉上连贯且符合指令的图片,开启CFG后的提升仅体现在整体平滑度和少量细节抑制上。与此形成对比的是,基于VQ-VAE纯重建词汇训练的早期自回归模型,一旦关闭CFG,生成质量会急剧下降。研究团队认为,这一差异的根源在于词汇的语义含量:ARM的视觉词本身已经内嵌了文字对齐的语义信息,因此在采样时条件信号已经足够强,不需要额外的"导航辅助"。这一发现在实际应用中有重要价值,因为去掉CFG可以将推理速度提升接近一倍。

**归根结底,ARM在做什么?**

说到底,ARM的研究回答了一个根本性的工程问题:能不能用一套统一的"图像语言",让同一个AI模型真正同时精通看图、画图和改图?答案是肯定的,前提是这套图像语言本身就被精心设计成语义与细节兼顾的。

研究团队的路径是:先花大力气训练一个"既懂意思又懂细节"的图像编码器,再把它接入一个标准的语言模型框架里做大规模训练,最后用强化学习打磨输出效果。这条路走通了,而且还带来了一个意外之喜:在统一的离散视觉词框架下,不同任务之间天然地存在协同效应,优化一个任务会带动其他任务一起进步。

这对普通用户来说意味着什么?在不远的将来,你也许只需要打开一个AI应用,就能既让它帮你分析一张照片里的内容,又能直接让它根据你的描述画出一张新图,或者把已有的照片按照你的想法改造——而这背后只有一个AI大脑在工作,不需要在不同工具之间反复切换,也不需要担心不同工具之间的信息传递损耗。

研究仍有提升空间——与专用于理解任务的顶级模型相比,ARM在MMMU等高难度理解测试上还存在一定差距;与专用于生成任务的最强扩散模型相比,极致的视觉保真度也仍有追赶余地。但这项研究证明了,在一个统一的自回归框架内,这三种能力可以同时存在、相互促进,而不是此消彼长。有兴趣深入探索这一方向的读者,可以通过arXiv编号2606.11188获取完整论文和研究团队公开的项目页面。

---

Q&A

Q1:ARM和普通的图像生成AI有什么区别?

A:普通图像生成AI通常只负责"根据文字画图",而ARM是一个同时能"看图说话""根据文字画图"和"按指令改图"的统一模型。它的核心区别在于使用了一套同时保留语义和视觉细节的统一视觉词汇,不需要像很多其他模型那样为理解和生成分别维护两套独立的视觉系统。

Q2:ARM的强化学习训练是怎么给AI打分的?

A:研究团队使用GPT-o3评估文字转图像任务,重点检查生成图片中物体的外观、属性和空间关系是否符合描述;使用GPT-4.1评估图像编辑任务,从指令执行程度、非目标区域的保留情况和整体视觉质量三个维度打分。模型每次生成16张候选图片,根据得分高低来调整参数,逐步学会更符合人类审美的生成方式。

Q3:ARM的统一视觉词汇是什么意思,为什么之前的AI做不到?

A:视觉词汇是指把图片切块后,将每块转换成一个可供语言模型处理的离散符号。之前的AI或者用语义导向的视觉词(擅长理解,不擅长还原细节),或者用重建导向的视觉词(擅长画图,不擅长语义理解)。ARM通过同时用四个不同方向的训练目标来监督视觉词的学习,使得同一套视觉词既包含足够的语义信息,又保留了足够多的视觉细节,从而一套词汇支撑起三种任务。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-