微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 华中科技大学与VIVO AI联合打造的"莫比乌斯":用不到2%的参数量,干掉百亿大模型的图像修复水平

华中科技大学与VIVO AI联合打造的"莫比乌斯":用不到2%的参数量,干掉百亿大模型的图像修复水平

2026-06-23 17:38
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-23 17:38 科技行者

这项由华中科技大学与VIVO AI Lab联合完成的研究,于2026年6月以预印本形式发布在arXiv论文平台,论文编号为arXiv:2606.19195。研究由华中科技大学和VIVO AI Lab的联合团队共同推进,感兴趣的读者可以通过上述编号在arXiv检索完整论文。

一、手机里的"修图大师"为何总比专业软件慢?

每当我们用手机拍了一张照片,背景里有根碍眼的电线杆,或者一张合影里多了个陌生人,我们都希望能轻松地把这些"杂物"从画面中抹去,并且让被抹去的区域自然地被背景填满——就好像那里从来什么都没有一样。这个过程在计算机视觉领域叫做"图像修复"或"图像补全",是一个历史悠久的经典问题。

近年来,随着AI生成图像技术的飞速发展,这件事变得越来越可能做到。市面上出现了一批能力极强的"大模型",比如FLUX.1-Fill-Dev和SD3.5 Large-Inpainting,它们能够以惊人的效果填补图片中的缺失区域,让结果看起来浑然天成。然而,这类模型的体量极为庞大——参数量高达100亿甚至更多,就好像一位需要住在五星级酒店、配备整个后勤团队才能出门工作的超级明星厨师。在手机或者资源有限的设备上,这样的"超级明星"根本无从施展,光是加载模型本身就要消耗大量内存和时间。

正因如此,华中科技大学与VIVO AI Lab的研究团队提出了一个颇具挑战性的问题:能不能训练出一位"小而精"的专科厨师,用一间迷你厨房、一套精简工具,烹饪出与五星级大厨不相上下的菜肴?这便是"莫比乌斯"(Moebius)诞生的初衷——一个仅有2.26亿参数(约0.22B)的轻量级图像修复框架,其体量不足FLUX.1-Fill-Dev的2%,却在多项标准测评中达到甚至超越了后者的修复质量,同时总推理时间提速超过15倍。

二、为什么不直接把大模型"缩水"就好了?

一个自然而然的想法是:既然大模型太重,直接把它裁剪小一点不就行了?研究团队最初也尝试了这条路,但结果令人沮丧。他们的实验基准是PixelHacker——一个约8.62亿参数、当时学术界的顶尖图像修复模型,也是莫比乌斯后来的"老师"。通过去掉PixelHacker中冗余的最后一个下采样阶段,参数量从8.62亿压缩到了5.26亿,图像质量的损失还算可以接受。

然而,当他们进一步尝试把模型里各个部件换成"轻量版"时,麻烦来了。具体来说,他们尝试把模型中负责"看局部细节"的标准卷积层换成更省资源的"深度可分离卷积"(DWConv,可以理解为把一道菜的烹饪步骤拆分成互不干扰的小步骤,每步只处理一种食材),把负责"全局信息交流"的注意力机制换成线性注意力等更高效的算子。结果却让人大跌眼镜:模型的图像质量评分(FID,数值越低越好)从32.75急剧恶化到43.58,劣化幅度超过30%,修复出来的图像一塌糊涂。

研究团队将这个现象命名为"表示瓶颈"(Representation Bottleneck)。简单来说,就是模型在经过大幅度"减肥"之后,失去了理解图像语义和空间结构的能力——就像一个原本能做满汉全席的厨师,突然只剩下一把菜刀和一口锅,很多精细的工序根本无法完成。图像修复这项任务对"语义理解"的要求极高:你要知道被遮住的区域里"应该"是什么,才能自然地填进去。缺乏表达能力的轻量模型,往往只能填出一片模糊的颜色块,或者生成与周围环境格格不入的内容。

更糟糕的是,PixelHacker所使用的"门控线性注意力"(GLA)这种高效的自注意力机制,从数学结构上就不支持"交叉注意力"操作。而交叉注意力恰恰是将外部语义信息(比如"这张图是海边场景"这样的全局先验知识)注入模型的关键通道。这意味着,你不能直接把GLA拿来用在同时需要自注意力和跨模态交互的场景中,否则模型会失去获取全局语义的能力。

三、莫比乌斯的核心魔法:用"摘要矩阵"代替繁重的注意力计算

面对上述困境,研究团队提出了一套全新的思路。他们不再试图简单替换现有算子,而是从头设计了两个全新的模块:Local-λ(局部λ)和Interactive-λ(交互λ)。这两个模块共同构成了莫比乌斯的核心计算单元——LλMI(Local-λ Mix Interaction,局部λ混合交互)块。

要理解这两个模块,可以用一个图书馆的比喻来贯穿整个说明。假设你是图书馆的管理员(模型),你的任务是根据读者(查询向量Q)的需求,从海量书架(输入特征图)中找到最相关的书籍(输出特征)。传统的注意力机制就像是每次有读者来访,你都要把图书馆里所有书的目录逐一翻阅一遍,然后给出推荐——这在书很少的时候还好,但书多了之后计算量会随书的数量平方增长,极其耗时。

Local-λ的解决方案则是:在每次开馆前,先把所有书的核心内容提炼成一本固定大小的"精华手册"λ,这个手册同时包含两部分:一部分叫做"语义内容摘要"(λ_c),通过对所有书的关键词做统计归纳得到;另一部分叫做"空间位置摘要"(λ_p),记录书架上哪些位置的书在主题上彼此相邻。当读者来访时,你只需要拿着这本精华手册查询即可,完全不需要再遍历整个书架。从数学上看,语义内容摘要的计算方式是对键矩阵K做softmax之后与值矩阵V相乘,得到一个固定大小的矩阵;而空间位置摘要则通过一个三维卷积操作(一种感知局部窗口内空间关系的算子)来提取。最终,查询矩阵Q分别与这两部分相乘并求和,得到融合了全局语义和局部空间连续性的输出。这样一来,计算复杂度从随图像像素数量平方增长变成了线性增长,大幅节省了算力。

Interactive-λ的逻辑与此类似,但它解决的是另一个问题:如何把"外部知识"(即全局语义先验,在莫比乌斯中具体指LCG嵌入,一种从未被遮住的图像区域提取出的"这张图是什么场景"的高维特征向量)高效地注入到模型内部。这个外部知识的规模远小于图像特征图,想要建立两者之间精确的空间对应关系非常困难——就好像你有一页只有关键词的摘要(外部语义),却要把它对齐到一整本书(图像特征)的每一页。

Interactive-λ的做法是:同样先把外部语义信息压缩成一个固定大小的"语义摘要矩阵"λ_c,同时引入一个轻量级的位置嵌入矩阵E_pos,用来记录图像不同位置的空间布局信息,生成"位置摘要矩阵"λ_p。图像特征作为查询Q,分别与这两个摘要相乘后叠加,就得到了融合了外部语义和空间布局的输出。这个设计从根本上解决了GLA无法做交叉注意力的问题,让轻量化架构也能无障碍地接收和利用全局语义先验。

在此基础上,研究团队还用两种高效算子替换了模型中其他耗资源的部分:用"深度残差块"(DW.Res)替换原本的标准卷积残差块,用于提取局部空间特征;用"Mix-FFN"替换原本的全连接前馈网络,后者将标准的全连接层替换为一种结合了深度卷积的混合结构,大幅减少参数量。实验表明,仅用Mix-FFN替换标准FFN就能再节省约4800万参数和270亿次浮点运算(GFLOPs),而对图像质量的影响微乎其微。

把Local-λ、Interactive-λ和Mix-FFN按顺序叠加,就形成了LλMI块。具体的数据流是:输入特征先经过层归一化后送入Local-λ模块做自聚合,结果加回输入;再经过层归一化后送入Interactive-λ模块融合外部语义,结果再次加回;最后经过Mix-FFN做特征变换,加回后输出。整个LλMI块取代了原本重型扩散模型中的"空间变换器块",以极小的参数量完成了相同的功能。

四、光有好架构还不够:知识蒸馏让小模型"开窍"

即便有了精心设计的LλMI架构,研究团队在实验中发现,仅靠标准的预测损失(即让模型预测的噪声尽量接近真实添加的噪声)来训练这个极度压缩的模型,最终的图像质量评分(FID)只能达到33.42,远未达到理想水平。这就好比一个接受了特殊训练课程的厨师,尽管学了正确的厨艺框架,但由于经验太少,做出来的菜仍然差强人意。

为了让这位"小厨师"真正达到"大厨"的水准,研究团队引入了一套"自适应多粒度蒸馏策略"。这里的"蒸馏"借用了"知识蒸馏"这一机器学习领域的经典概念:让一个能力强大的大模型(称为"教师")指导一个小模型(称为"学生")学习,让小模型的行为尽量向大模型靠拢。在莫比乌斯的框架里,教师模型是预训练好的PixelHacker(8.62亿参数),学生模型是莫比乌斯自己(2.26亿参数)。

蒸馏策略分为三个层面,形成一个从粗到细的监督体系。第一层是"粗粒度蒸馏":在图像特征图被压缩到最小尺寸(16×16像素的特征空间)的中间瓶颈处,强制要求学生模型的中间表示与教师模型在对应位置的中间表示尽量接近,损失函数是两者的欧氏距离的平方。这相当于要求小厨师在备料阶段(最浓缩、最关键的信息层)就要和大厨的思路对齐。

第二层是"细粒度蒸馏与任务监督":在最终输出层(64×64像素的特征空间),同时使用两个损失来监督学生。一是标准任务损失,即要求学生预测的噪声与真实噪声(ground truth)接近;二是知识蒸馏损失,要求学生的最终预测结果与教师的预测结果接近。两种损失共同约束最终输出,让小模型不仅要"做对"(接近真实答案),还要"学像"(接近教师的输出风格)。

第三层是"潜在空间感知蒸馏":为了进一步提升生成图像的视觉感知质量,研究团队引入了E-LatentLPIPS这一感知损失——它能在不把潜在特征解码回像素空间的前提下,直接在潜在空间中衡量感知质量。这一设计非常关键:如果在每次训练迭代中都把高分辨率的潜在特征解码回像素图,再计算感知损失,内存消耗会极为巨大,对一个轻量化框架来说根本不现实。在潜在空间直接计算感知损失,既保留了感知质量的约束,又大幅节省了训练资源。

然而,将三个层次的损失函数合并优化时,研究团队遇到了另一个难题:不同损失的量级和梯度贡献差异悬殊,如果用固定的权重系数来平衡它们,调参极为困难,而且容易导致训练不稳定。为此,他们设计了一套"自适应梯度平衡机制":通过计算各个损失相对于关键参数层的梯度范数(即梯度的"强度"),动态地调整每个损失的权重,使得任何一个损失的梯度都不会压制其他损失,实现自动平衡。具体来说,细粒度的蒸馏损失和感知损失的权重,被设置为任务损失的梯度范数除以各自的梯度范数;粗粒度蒸馏损失与细粒度输出损失之间的权重,同样由梯度范数之比动态决定。这种机制的灵感来源于GAN(生成对抗网络)的损失平衡思路,有效稳定了训练过程,让学生模型能够快速收敛。

五、实验结果:小模型的大胜利

莫比乌斯的实验覆盖了两大类场景和多个标准数据集。在自然场景图像修复方面,研究团队在Places2数据集上进行了系统评测,这个数据集包含了超过180万张涵盖各种自然场景的图片,是图像修复领域最常用的基准之一。在多个评测子集(小遮罩、大遮罩、测试集等)上,莫比乌斯的表现均与PixelHacker和FLUX.1-Fill-Dev相当,甚至在小遮罩条件下以0.92的FID和0.091的LPIPS(感知相似度,数值越低越好)超越了FLUX.1-Fill-Dev(FID为0.94)。相比之下,SD3.5 Large-Inpainting的表现明显更差,在多个子集上的FID劣于莫比乌斯数倍。

在人像场景方面,莫比乌斯的表现更为亮眼。在CelebA-HQ(高清人脸数据集)的512×512图像测试中,莫比乌斯取得了5.39的FID和0.122的LPIPS,与专门针对大面积遮挡优化的MAT模型(4.86 FID)处于同一水平,远超所有其他扩散模型。在FFHQ(另一高质量人脸数据集)的256×256测试中,莫比乌斯获得8.15 FID和0.231 LPIPS,再次压倒FLUX.1-Fill-Dev(11.19 FID)和SD3.5 Large-Inpainting(109.42 FID,差距高达1243%)。从直观效果来看,在人脸修复中,莫比乌斯能够精准还原眼神对齐、皮肤纹理等细节,而大型生成式模型在这类需要高精度空间语义对应的任务上,往往产生结构混乱或模糊。

在效率方面,对比数据更加直观。莫比乌斯在单步推理时的延迟仅为26.01毫秒,理论计算量为0.154万亿次浮点运算(TFLOPs);而PixelHacker的延迟为46.89毫秒,FLUX.1-Fill-Dev则高达161.01毫秒,是莫比乌斯的约6倍。更关键的是,工业级大模型通常需要50步(FLUX.1-Fill-Dev)或28步(SD3.5)采样才能生成一张图,而莫比乌斯只需20步。综合步数来看,完成一次修复任务,FLUX.1-Fill-Dev总计需要约8.05秒,而莫比乌斯只需0.52秒,速度差距超过15倍。

为了更全面地评估视觉质量,研究团队还组织了一项双盲用户偏好实验。22名参与者(包含专家和普通用户)在不知道图片来源的情况下,对自然场景、人像场景和真实世界目标移除三类任务各50组对比图进行偏好投票。结果显示,莫比乌斯的平均选择率为31.76%,与教师PixelHacker的32.18%几乎持平,显著高于FLUX.1-Fill-Dev(23.70%)和SD3.5 Large-Inpainting(12.36%)。在人像场景中,莫比乌斯甚至以32.27%的偏好率排名第一,超过了自己的老师。

六、消融实验:每个设计决策都不是随意的

为了验证每一个设计选择的必要性,研究团队进行了系统的消融实验,逐一替换或去除各个组件,观察性能变化。他们构建了一个包含15组对照实验的分析表,覆盖了从架构选择到训练策略的各个维度。

在架构层面,实验证明,单独使用任何一种轻量化替换都会导致性能下降,只有Local-λ、Interactive-λ、Mix-FFN和DWConv四者协同作用,才能在极致压缩的前提下保持最佳性能。例如,在引入知识蒸馏的前提下,基于GLA的标准结构(5.26亿参数)FID为26.81,而莫比乌斯的完整LλMI结构(2.26亿参数)FID为26.43,参数量少了一半多,质量却略有提升,充分说明新架构对参数的利用效率更高。

在蒸馏策略层面,消融实验逐步添加各个损失组件,观察FID的变化。仅使用粗粒度蒸馏损失时,FID高达74.20,模型几乎无法生成有意义的内容;加入细粒度蒸馏损失后,FID降至36.17;再加入任务损失后降至32.59;最后加入潜在感知损失后,FID降至26.43,LPIPS为0.258。每个组件的加入都带来了可观的质量提升,证明多粒度蒸馏策略的每一层都是不可缺少的。

此外,研究团队在置信度引导(Classifier-Free Guidance,CFG)的尺度选择上也做了详细验证。CFG是一种在推理时调节"生成质量与多样性平衡"的技术,类似于调节照片的对比度——太低了画面不够清晰,太高了又会失真。实验发现,自然场景的最优CFG尺度为2.5,人像场景为2.0,这两个数值被设定为莫比乌斯的默认推理配置。

七、真实世界应用与局限性

除了标准学术基准,研究团队还测试了莫比乌斯在真实世界目标移除任务中的表现。真实场景的遮罩往往不规则,背景复杂,对模型的理解和生成能力要求更高。实验显示,在移除电线杆、清除前景人物后还原背景等任务中,莫比乌斯能够准确理解全局场景结构,生成自然连贯的背景内容,而FLUX.1-Fill-Dev和SD3.5在这些场景中则频繁出现语义不一致、颜色偏差等问题。研究团队还将莫比乌斯与商业图像编辑系统进行了对比,包括Nano Banana和Qwen Image Edit,结果显示莫比乌斯在视觉质量上与这些参数量远大于自己的商业系统相当,进一步证明了其作为开源轻量级工具的实用价值。

当然,莫比乌斯并非没有局限性。研究团队在补充材料中坦诚地展示了失败案例:在极小区域的精细纹理修复中(例如遮挡区域背景纹理极为复杂且上下文信息极少的情况),莫比乌斯有时会生成不够逼真的细节,不及拥有更多参数的PixelHacker。这是极致压缩带来的固有代价,在参数量减少到原来四分之一以下的前提下,这种程度的质量损失被认为是完全可接受的权衡。

此外,研究团队还对莫比乌斯的泛化能力进行了评测。他们从LVIS数据集中采样了1万张图像作为"分布外"自然场景测试集,从DeepFakeFace数据集的维基百科子集中采样了3000张人脸图像作为"分布外"人像测试集,使用在Places2和CelebA-HQ上训练的权重直接进行推理。结果显示,莫比乌斯在两个分布外集合上均表现稳健,FID和LPIPS与其他方法相比依然具有竞争力,验证了其良好的零样本泛化能力。

归根结底,莫比乌斯这项工作真正令人印象深刻的地方,不在于它在某个单一指标上打破了纪录,而在于它证明了一件此前被认为极难实现的事:一个体积极小的专科模型,通过精心的架构创新和训练策略设计,完全可以在特定任务上与体积是它50倍的通用大模型分庭抗礼。对于普通用户来说,这意味着未来的手机、平板乃至嵌入式设备,都有可能原生搭载高质量的AI图像修复功能,而不需要将照片传到云端、等待大型服务器处理后再返回结果。这种"把能力装进口袋"的技术路径,或许会深刻改变AI工具触达普通人的方式。当然,目前莫比乌斯的训练仍依赖大型GPU集群(16块NVIDIA L40S),其架构能否进一步迁移到其他视觉生成任务,以及能否在更严苛的资源约束下保持性能,仍是值得持续探索的开放问题。有兴趣深入了解技术细节的读者,可以通过arXiv论文编号2606.19195查阅完整原文。

Q&A

Q1:莫比乌斯(Moebius)模型和FLUX.1-Fill-Dev相比,修复效果真的差不多吗?

A:从论文实验数据来看,莫比乌斯在多个标准测试集上的FID和LPIPS指标与FLUX.1-Fill-Dev相当,在小遮罩自然场景和人像修复任务上甚至优于后者。但莫比乌斯是经过专项训练的专科模型,适合在固定类型的修复任务上使用,而FLUX.1-Fill-Dev是零样本通用模型,灵活性更强。两者各有侧重,不能简单说谁完全碾压谁。

Q2:LλMI块和普通注意力机制有什么区别,为什么能做到更省资源?

A:普通注意力机制需要对图像中每个位置与所有其他位置计算相关性,计算量随像素数量平方增长。LλMI块的核心思路是把所有位置的信息先压缩成一个固定大小的"摘要矩阵"λ,查询时只与这个小矩阵交互,计算量变成线性增长。同时,它还专门设计了Interactive-λ模块来处理外部语义信息的注入,弥补了以往线性注意力机制无法做交叉注意力的缺陷。

Q3:莫比乌斯的知识蒸馏和普通的模型压缩有什么不同?

A:普通模型压缩通常是直接裁剪或量化现有大模型的权重,而莫比乌斯的知识蒸馏是让一个全新设计的小模型,在训练过程中同时向大模型的中间表示(粗粒度)、最终预测(细粒度)以及感知质量(潜在感知损失)三个层面对齐学习。此外,莫比乌斯还引入了自适应梯度平衡机制,动态调整各个损失的权重,避免手动调参的困难,这是其与一般蒸馏方法的关键区别。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-