微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 北大字节联手打造的AI"多线程"识图黑科技:让机器同时"看懂"图片里的每一个角落

北大字节联手打造的AI"多线程"识图黑科技:让机器同时"看懂"图片里的每一个角落

2026-06-24 13:35
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-24 13:35 科技行者

这项由北京大学MSALab实验室与字节跳动联合完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.19534,感兴趣的读者可以通过该编号查阅完整原文。

假设你是一位博物馆讲解员,面前摆着一幅画满了人物、动物和风景的复杂画作,馆长要求你同时为三位游客分别解说画面左边的骑士、右边的骑士、以及中间的城堡,但要求讲解不能重叠。如果你必须一次只讲一个,先讲骑士A,再讲骑士B,最后讲城堡,那么三位游客就得排队等着,效率极低。但如果你能"分身",三个讲解同时进行、互不干扰,效率自然飞涨。这就是这篇论文要解决的核心问题——让AI拥有"分身术",同时把图片里的多个区域讲清楚,而不是一个一个慢慢来。

这项研究提出了一个叫做PerceptionDLM的系统,它的核心突破在于利用一类名为"扩散语言模型"(Diffusion Language Model,简称DLM)的新型AI,天然支持并行生成文字描述,从而让AI同时为图片里的多个区域"出具说明书",速度比传统方法快了数倍,而描述质量依然保持竞争力。

一、多线程的根本难题:为什么AI"一心不能二用"?

在深入了解PerceptionDLM之前,值得先弄清楚现有AI视觉描述系统的工作方式,以及它们为何面临效率瓶颈。

目前绝大多数多模态大模型(也就是能同时处理图片和文字的AI,以下统称视觉语言模型)都依赖一种叫做"自回归生成"的方式来输出文字。自回归的意思大致相当于:写文章时必须先写第一个字,根据第一个字决定第二个字,再根据前两个字决定第三个字,以此类推,永远只能串行推进,不能跳步,也不能并行。这就好比一位打字员只有一根手指,只能一个字一个字地敲,不管任务多紧急都无法加速。

当任务是描述图片中的单个区域时,这种方式虽然慢,但还可以接受。然而当需要同时描述三个、四个甚至更多区域时,AI就不得不把这些任务排成一排,依次完成,推进速度就像交通高峰期的单车道公路,每多一个区域任务,等待时间就线性增长。以GAR这款专门做区域描述的AI为例,它对两个区域的描述耗时大约3.45秒,五个区域则跳升到6.64秒,耗时几乎随区域数量成正比地增加。对于需要同时理解图片中大量细节的应用场景,这显然是难以接受的。

这就是研究团队选择转向"扩散语言模型"的根本原因。

二、扩散语言模型:从"逐字打字"到"集体填空"

扩散语言模型的工作方式与自回归模型截然不同,更接近于一种"集体填空游戏",而非逐字推进的写作过程。

具体来说,可以把扩散语言模型的生成过程理解成这样:先准备好一张全部由空白(用特殊符号[MASK]表示)组成的答题纸,然后经过若干轮迭代,每一轮都把其中一部分空白填上合适的内容,直到所有空白都被填满,一段完整的文字描述就生成了。这个过程更像是一位画家先画出大致轮廓,再逐步细化细节,而不是从左到右一笔一划地精确临摹。

这种设计的关键优势在于:由于每一轮都可以同时处理多个空白位置,模型在生成文字时天然具备"并行性"。更重要的是,如果把多个不同区域的描述任务同时塞进这张答题纸,模型可以在同一轮次里同时推进所有区域的填写,而不需要把它们排队处理。这就相当于考场上有多位同学可以同时答题,而不是只让一个人答完所有人的题。

然而,把多个区域任务直接塞进同一张答题纸也会带来新的麻烦:如果描述区域A的文字和描述区域B的文字混在一起互相影响,AI很可能会把A的特征写进B的描述里,或者反过来,造成"张冠李戴"的混乱。解决这个问题,正是PerceptionDLM的核心技术贡献所在。

三、从零搭建"底座":PerceptionDLM-Base的诞生

在实现多区域并行描述之前,研究团队首先需要一个强健的"底座模型",也就是一个具备良好视觉理解能力的扩散型视觉语言模型,这便是PerceptionDLM-Base。

PerceptionDLM-Base的整体架构就像一套分工明确的流水线。第一个环节是视觉编码器,它的工作是"看图",把输入的图片转化为机器能理解的数字信号,具体采用的是SigLIP-2这款经过大规模预训练的视觉编码器。第二个环节是一个轻量级的连接器,由两层神经网络构成,专门负责把视觉信号翻译成语言模型能读懂的"语言",就像一位专业口译员坐在图像和文字之间。第三个环节则是扩散语言主干,采用LLaDA-8B,这是当前最先进的离散扩散语言模型之一,拥有80亿个参数,承担真正的文字生成任务。

为了处理高清图片,研究团队还引入了动态分辨率策略。具体做法是:把输入图片按照比例切成若干块512×512像素的小方格,每个小方格单独处理,再通过像素重排操作把视觉标记数量压缩为原来的四分之一,最后把所有结果拼接起来,同时额外附上一张缩略图以保留整体感。这种处理方式让模型既能看清细节,又不会因为图片过大而消耗太多算力,就像一位读者既逐字通读了每一段落,又扫读了全文摘要一样。

在训练层面,PerceptionDLM-Base采用了四个阶段循序渐进的策略,就像培养一位专业厨师要经历基础技能、广博食谱、精细烹饪、高端创作四个阶段一样。第一阶段使用Bee-Training-Data-Stage1数据集的100万条样本,主要训练连接器这个"口译员",让视觉特征和语言嵌入空间建立基本对应关系,此时语言主干大部分参数保持冻结不动。第二阶段使用1400万条样本的Bee-Training-Data-Stage2数据集,全面激活语言主干进行大规模知识注入,让模型接触海量视觉概念,增强对多样图像内容的理解能力。第三阶段使用来自LLaVA-OneVision-1.5-Instruct-Data的2200万条指令微调样本,这些数据涵盖视觉问答、推理、文字识别、定位等多种任务类型,让模型学会按照人的指令来回答问题,而不只是被动描述图片内容。第四阶段使用Honey-Data-15M数据集的1500万条高质量样本,这批数据特别强调复杂推理和长篇回答,并包含双层次的思维链注释,进一步提升模型的推理深度和回答质量。

在视觉编码器的训练策略上,研究团队进行了仔细对比,发现把视觉编码器冻结(即不更新其参数)反而比全参数训练效果更好。在八个典型测试上,冻结编码器的方案在MMStar上得到63.7分对比61.9分,在MathVista上65.5分对比61.9分,在MMVP上82.0分对比79.7分,在HallusionBench上58.4分对比54.6分,几乎全面占优。原因在于,视觉编码器经过大规模预训练已经具备非常稳健的视觉表征能力,强行更新反而容易破坏这种能力,就像让一位经验丰富的大厨从头学习切菜手势,可能反而把原本的好手艺弄乱了。

对PerceptionDLM-Base进行的大规模测试结果相当亮眼。在16个不同的多模态基准测试中,PerceptionDLM-Base在15个上超过了同为扩散模型阵营的LLaDA-V,与更强的扩散模型对手SDAR-VL和Dream-VL相比,也展现出明显的综合优势,尤其在通用视觉问答、细粒度感知和抗幻觉能力上表现突出。与同规模的自回归模型(如Qwen2.5-VL-7B和InternVL3-8B)相比,PerceptionDLM-Base在细粒度感知类任务上甚至能系统性地超越它们,例如在MMVP测试上以82.0分超越两者的73.3分和80.0分,在BLINK测试上以60.3分超越55.3分和55.5分。唯一的短板在于复杂数学推理类任务,研究团队认为这是扩散语言模型并行解码方式的固有限制,并将其留作未来借助强化学习来突破的研究方向。

四、多区域并行描述的三件法宝

有了强健的底座之后,研究团队开始真正攻克并行描述多个区域的技术难题。他们设计了三个相互配合的机制,分别解决不同层面的问题,就像三位保安各守一道关卡,共同维护秩序。

第一件法宝是"RoI特征回放"。RoI是Region of Interest的缩写,意思是感兴趣的区域。这个机制的思路类似于警察追踪嫌疑人时给每人贴一张专属照片:对于图片中的每一个指定区域,系统通过RoI对齐操作从视觉编码器的输出中提取该区域专属的局部视觉特征,然后把这些特征以"占位符标记"的形式插入到对应描述任务的输入序列中。这样一来,描述区域A的文字生成任务就带着区域A的专属视觉证据,描述区域B的任务带着区域B的证据,各有各的参照。默认设置下,每个区域会提取4×4即16个局部特征标记。

第二件法宝是"区域提示嵌入"。即便有了局部视觉特征,如果模型不知道"这段文字是在描述哪个区域",它仍然可能产生混淆。为此,研究团队为每个区域设计了一个独立的可学习嵌入向量,相当于给每个区域贴一张独特的"身份证",并把这张身份证的信息融合进该区域对应的视觉标记里,让模型在生成文字时始终能对应到正确的目标。研究团队在消融实验中发现,一旦去掉区域提示嵌入,模型会对所有区域生成几乎完全一样的文字,平均准确率从53.7%灾难性地跌落至1.1%,这充分说明区域身份识别是并行描述能正确工作的核心前提。

第三件法宝是"结构化注意力掩码"。扩散语言模型在生成文字时,每个位置的标记都会"关注"其他位置的信息,以获得上下文。但如果允许描述区域A的文字和描述区域B的文字互相"偷看",就会导致特征串位。结构化注意力掩码的设计原理就是在这些区域之间建立一道无形的"隔墙":描述区域i的文字标记,只允许关注全局视觉标记、共享的文字提示标记、属于区域i的局部特征标记,以及同属区域i的描述文字,而对其他区域的局部特征和描述文字则一律屏蔽。这种设计在保留全局视觉背景的同时,强制执行区域之间的独立性,让每个区域的描述都只从自己的视觉证据出发,不受其他区域干扰。实验表明,如果用普通的全注意力替换结构化注意力,平均准确率会下降6.2个百分点,充分验证了这道"隔墙"的必要性。

五、给AI考试出新题:ParaDLC-Bench基准测试

研究团队还意识到,现有的评测体系并不适合评估并行多区域描述能力——现有测试大多一次只测一个区域,既无法检验模型在同时处理多个区域时是否会"张冠李戴",也无法反映推理效率的差异。于是他们构建了一套全新的测试集,命名为ParaDLC-Bench。

ParaDLC-Bench的图片来源于Objects365 V2验证集和DaTaSeg Objects365实例分割数据集,共包含100张图片,其中54张来自前者(含178个区域实例),46张来自后者(含121个区域实例)。每张图片至少包含2个需要同时描述的区域,大部分图片有2到4个区域,部分极具挑战性的图片甚至有多达8个区域。区域的平均面积仅占图片总面积的7%,大量微小细节目标的存在进一步提高了测试难度。

评测方式采用"LLM裁判"方式:先让被测模型对图片中的多个区域生成并行描述,再把这些描述连同预设的评测问题一起送给GPT-5.2充当裁判,由裁判判断描述是否准确。研究团队在对比中注意到,裁判模型自身的推理能力会显著影响评测的可靠性,因此选择了比原始DLC-Bench所用的Llama-3.1-8B更强大的GPT-5.2,并在附录中额外用Qwen3.5-27B和Gemini-3.1-Pro进行了稳健性验证,确认主要结论在不同裁判模型下保持一致。

评测题目分为两类。正向题考察模型是否准确描述了目标区域的特定属性,描述正确得1分,未提及得0分,描述错误扣1分。负向题及干扰题则是ParaDLC-Bench的核心创新,除了检查模型是否出现常见但实际不存在的属性幻觉外,特别增加了跨区域干扰检测:专门考察模型是否会把其他同时存在的区域的属性错误地写进当前区域的描述里。成功避免这种串位得1分,发生串位扣1分。通过这套机制,ParaDLC-Bench不仅能衡量描述质量,还能评估模型在多目标并行任务中保持独立性的能力。整个测试集经过人工标注员的严格多轮交叉验证,最终包含2345道经过人工核验的选择题。

六、训练数据的制造流水线:ParaCaption-5.7M

要让PerceptionDLM真正学会并行描述多个区域,需要大量"一张图片、多个区域、多段描述"格式的训练数据,但现有数据集几乎不包含这种同时标注多个区域的样本。研究团队因此设计了一套自动化数据构建流水线,从头制造了规模达570万条的训练数据集,称为ParaCaption-5.7M。

数据来源分两路。一路是SA-1B数据集,这是Meta公司发布的超大规模分割数据集,包含数以亿计的区域掩码。考虑到SA-1B中存在大量细碎的零件级别区域不适合用于整体描述,研究团队首先过滤掉完全被遮挡的掩码(这类掩码通常只是物体的一个小零件),然后用GAR-8B这款当时最强的区域描述模型为每个区域生成初始描述,再用一个语言模型从描述中提取物体类别,接着用SAM3重新预测对应掩码,通过计算与原始掩码的IoU(交叉面积与并集面积之比,用来衡量两个掩码的重合程度)来过滤质量不佳的样本。最终从83000张图片中获得了230万个高质量区域描述。

另一路是COCONut数据集,这个数据集本身就带有掩码和类别标注,省去了掩码过滤的步骤,研究团队同样用GAR-8B生成描述,再用Qwen3-8B判断描述是否与标注类别语义一致,从334000张图片中获得了340万个区域描述。

两路数据汇总后,还需经过统一的后处理:控制描述长度,同时过滤重复啰嗦的幻觉性内容,确保最终文字质量。消融实验清晰地证明了数据规模和数据多样性的双重重要性:仅用DAM数据集训练时平均准确率为53.7%,加入COCONut来源数据后提升至57.7%,再加入SA-1B来源数据后进一步升至62.4%,每增加一类数据源都带来显著提升。

七、实测结果:速度与质量的双线战绩

在ParaDLC-Bench上,PerceptionDLM的表现展现出几个维度的特点。

在扩散模型阵营内部,PerceptionDLM以62.4%的平均准确率(正向题42.3%,负向题82.4%)大幅领先于同类对手,几乎是SDAR-VL(31.3%)和LLaDA-V(35.2%)的两倍。在对比中值得关注的是,LLaDA-V在评测时已经将去噪步数设置为等于生成长度的最大值,也就是说它已经在尽其所能地提升质量,即便如此仍远不及PerceptionDLM。这说明差距不仅仅来自推理配置,更根本地源于架构设计和训练数据的差异。

与通用视觉语言模型相比,PerceptionDLM的62.4%超过了Gemini-3.1-Pro的63.7%,几乎持平,而Gemini-3.1-Pro是谷歌旗下极强的闭源商业模型,PerceptionDLM能在多区域并行任务上追平它,着实令人印象深刻。

与专门针对区域描述优化的自回归模型(如DAM-3B和GAR-8B)相比,PerceptionDLM的准确率(62.4%)略低于它们(分别为69.2%和69.5%),但差距并非天壤之别。更关键的对比在于效率:研究团队用一个叫做TPF(每次前向传播生成的平均标记数,Token Per Forward)的指标来衡量并行程度。自回归模型每次前向传播只能生成1个标记(TPF=1),而PerceptionDLM的TPF达到2.9,相当于每次前向传播平均生成接近3个标记。在整个ParaDLC-Bench的完整评测中,PerceptionDLM仅耗时276秒,而GAR需要479秒,PixelRefer更需要718秒。

从吞吐量(每秒生成的标记数,即TPS)的角度看,在一张图片有5个区域需要描述时,PerceptionDLM的TPS达到约108,而GAR始终维持在约28左右,两者相差约3.5倍。更生动的数字是:PerceptionDLM处理5个区域的单张图片耗时约2.91秒,而GAR需要6.64秒;两个区域时PerceptionDLM约2.60秒,GAR约3.45秒。随着区域数量增加,GAR的耗时线性增长,而PerceptionDLM的耗时几乎维持稳定,这正是并行处理的核心价值所在。

另一组更有说服力的数据来自固定工作量测试:对于同一张含有4个区域的图片,如果用并行度为1(逐个处理)的方式,耗时10.04秒;并行度提升到2时耗时5.31秒,速度提升约1.89倍;并行度提升到4时耗时仅2.92秒,速度提升约3.44倍,吞吐量也相应地从约13 TPS攀升至约97 TPS。这组数据直观地说明了并行机制能带来的加速空间,以及当前实现方式已经充分发挥了这一优势。

在单区域测试集DLC-Bench上,PerceptionDLM的表现(平均准确率53.1%)虽然低于专门的自回归区域模型(DAM为67.3%,GAR为67.8%),但显著高于同类扩散模型基线(LLaDA-V仅24.6%),说明其单区域描述能力也处于扩散模型阵营中的领先水平。研究团队还专门进行了"单掩码格式训练"的消融实验,确认在DLC-Bench上PerceptionDLM单掩码训练(52.1%)与并行训练(53.1%)结果相近,说明并行训练策略并未对单区域能力造成损失。

关于去噪步数对精度和速度的权衡,研究团队在Qwen3.5-27B裁判下进行了系统测试。16步时平均准确率69.0%,耗时138秒;32步时73.5%,耗时276秒;48步时70.5%,耗时411秒;64步时67.5%,耗时549秒。32步是最优平衡点,步数继续增加反而导致精度下降,可能是过多去噪步骤引入了累积错误。

还有一个边缘情况值得一提:当需要描述的区域数量超过训练时设定的最大提示数量(默认为6个)时,模型会被迫对多个区域共用同一个区域身份标记。测试结果显示,这会导致平均准确率从73.5%下降至68.6%,属于"优雅降级"而非崩溃,说明模型具有一定的鲁棒性。实际部署时,推荐的应对方案是将超量的区域分成多个批次分别处理,这样依然比逐个串行处理快得多。

说到底,PerceptionDLM这项研究的意义在于证明了一件并非理所当然的事:扩散语言模型不仅仅是自回归模型的一个"平替",更是在某些特定场景下拥有结构性优势的全新范式。当任务天然包含多个并行子任务时,扩散模型的并行生成能力就从"特性"变成了"优势",而多区域图像描述恰恰是这样的场景。

这对普通人意味着什么?当未来的手机相册软件自动为你拍的全家福中每一位成员生成详细描述,或者无人驾驶系统同时识别路口所有行人、车辆和标志牌,又或者医疗AI同时标注一张CT图像中的多处病变区域时,背后支撑这些功能的,正是像PerceptionDLM这样能够并行处理多个区域的视觉理解系统。效率不是一个冷冰冰的技术指标,它最终决定了AI能做什么、多快做到,以及在实际产品中能否真正用得起来。

这项研究还留下了几个清晰的待解问题,值得持续关注。多步去噪过程仍然是速度的限制因素,如何通过步骤蒸馏等技术将其进一步压缩,是一个直接的优化方向。在极度密集或语义相近的区域中,属性串位问题仍然存在,更精细的注意力设计或专门的对比学习目标有望改善这一问题。而扩散模型在复杂推理任务上的短板,则指向了将强化学习引入扩散视觉语言模型这一更宏观的研究课题。有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2606.19534查阅完整原文,代码和模型也已在GitHub和HuggingFace上公开发布。

Q&A

Q1:PerceptionDLM和普通的图片描述AI有什么不同?

A:普通图片描述AI(自回归模型)每次只能针对一个区域逐字生成描述,多个区域只能排队串行处理,区域越多耗时越长。PerceptionDLM基于扩散语言模型,能在一次生成过程中同时为多个区域填写描述,类似于多人同时答题而非一人依次作答,在处理5个区域时速度约是传统方式的3.5倍,而描述质量仍保持竞争力。

Q2:ParaDLC-Bench和已有的图像描述测试集相比有什么特别之处?

A:现有测试集通常一次只考察对一个区域的描述质量,无法测试AI同时处理多个区域时是否会把不同区域的属性搞混。ParaDLC-Bench专为多区域并行场景设计,包含2345道经人工核验的题目,特别增加了"跨区域干扰检测"题目,专门考察模型在描述某个区域时是否会错误地引入相邻区域的属性,这是当前同类测试中独有的设计。

Q3:PerceptionDLM在哪些实际应用场景中可能发挥作用?

A:任何需要同时理解图片中多个区域的场景都可能受益,例如自动为照片中每位成员生成详细说明的相册软件、无人驾驶系统同时感知多个路面目标、医学影像AI同时标注多处病变区域,以及电商平台自动为产品图片中的多个组件生成描述等。PerceptionDLM的并行处理能力使这些应用在推理效率上更具实用性。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-