微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 香港科技大学等多机构联手,一个模型搞定15种视频任务?这项研究彻底打破了"一个模型只能做一件事"的魔咒

香港科技大学等多机构联手,一个模型搞定15种视频任务?这项研究彻底打破了"一个模型只能做一件事"的魔咒

2026-05-08 11:36
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-08 11:36 科技行者

这项由香港科技大学多媒体实验室(MMLab@HKUST)领衔,联合北京航空航天大学、南京大学、北京智源人工智能研究院、香港中文大学、清华大学、斯坦福大学等多所顶尖机构共同完成的研究,发表于2026年的SIGGRAPH(计算机图形学与交互技术特别兴趣组会议),论文编号为ACM DOI: 10.1145/3811304,Article 51,共17页。有兴趣深入了解的读者可通过该编号查询完整论文。

先来说说这项研究的核心魔力在哪里。如果你曾经用手机拍过视频,你可能想过:要是能自动把视频里的光影效果单独提取出来,或者把视频里的人物从背景里干干净净地剪出来,那该多好。这类需求在影视制作、游戏开发、虚拟现实里无处不在。然而以往的做法非常麻烦——你需要一个专门的工具来做"光影分解",另一个专门的工具来做"人物抠图",再用另一个工具来做"视频重新上色"……每个工具只会做一件事,互相之间还不兼容。这就像你家厨房里,炒菜只能用炒菜锅,煮汤只能用汤锅,煎蛋只能用煎蛋锅,而且这三口锅完全无法互相替代——不仅占地方,还效率低下。

研究团队提出的 **UniVidX** 框架,就是要打造一口"万能锅",让一个模型能同时胜任十五种不同的视频处理任务,而且还能举一反三、触类旁通,即便只用不到一千段训练视频,也能在真实世界的各种场景下表现出色。

一、为什么以前的方法总是"一根筋"

要理解这项研究的突破,得先理解旧方法的根本局限在哪里。

以往,人工智能处理视频的方式,就像一个只经过单一岗位培训的工人。你想让他把视频里的光照和物体颜色分开(这在专业领域叫"逆向渲染"),就得专门训练一个模型;你想让他把前景人物从背景里抠出来(叫"视频抠图"),就得再训练另一个模型;你想让他根据文字描述直接生成带有光影、颜色、法线信息的视频(叫"文字到本征图"),又得再搞一个新模型。每个模型都只认识固定的"输入→输出"路线,比如"给我一段RGB视频,我输出光照图",或者"给我文字描述,我输出前景图",绝对不会有第三种组合。

这带来了两个严重问题。第一,模型的用途被"锁死"了——你不能临时改变主意说"这次我想给它提供光照图,让它推断颜色",因为它根本没学过这种反向操作。第二,当你需要同时获得多种结果时(比如既要光照图,又要法线图,又要颜色图),你只能把多个模型串起来用,前一个模型的输出喂给下一个模型,这样一来误差会层层累积,最终各个结果之间往往出现"对不上号"的情况——光照图显示左边有强光,但法线图却说表面朝着右边,两者自相矛盾,就像两个证人给出了互相矛盾的证词。

正是为了解决这两个根本性的问题,UniVidX 应运而生。它的核心思路是:把所有这些任务都统一放进一个框架里,让模型在训练的时候就学会"任意排列组合"——今天你给它颜色图,它能推算光照;明天你给它文字描述加上法线图,它能生成全套结果;后天你什么视觉信息都不给,只给文字,它能从零开始生成一切。

二、站在"视频扩散模型"这个巨人的肩膀上

在深入介绍 UniVidX 的三个核心设计之前,有必要解释一下它依赖的"地基"是什么。

近年来,一类叫做"视频扩散模型"(Video Diffusion Model,简称 VDM)的人工智能系统取得了令人瞩目的进展。这类模型在海量视频数据上训练,学会了"世界是什么样子的"——物体在光线下应该如何显示颜色,运动中的物体应该如何变形,镜头移动时场景应该如何变化。这些知识极为丰富,远超我们通常所说的"画面好看",它包含了对物理世界深层规律的某种隐性理解。

研究团队选择以 Wan2.1-T2V-14B 作为骨干模型——这是一个拥有140亿参数的大型视频扩散模型,它原本的主要能力是"根据文字生成视频"。UniVidX 的策略是:不从零开始训练新模型,而是在这个已经积累了大量世界知识的现成模型上,用非常轻量的方式进行定制改造。这就像你不需要从头培养一位厨艺大师,而是找来一位已经精通烹饪原理的名厨,然后教他几道你需要的特色菜——效率要高得多,而且他原有的烹饪直觉和判断力完全保留下来,能帮助他在面对没见过的食材时也能做出合理判断。

正是这种"借力打力"的策略,解释了为什么 UniVidX 训练数据需求如此之少——仅需不到一千段视频,就能泛化到训练数据之外的各种真实场景,包括室内场景、人物、动物等。

三、"随机条件遮蔽":让模型学会任意排列组合

UniVidX 的第一个核心设计叫做"随机条件遮蔽"(Stochastic Condition Masking,SCM)。这个名字听起来很技术性,但背后的思路其实相当直观。

回到那个"万能厨师"的比喻。要培养一个能灵活应对各种烹饪需求的厨师,最好的训练方式不是每次都固定给他"食材A→做菜B"的练习,而是每次练习时随机决定:今天给他食材A和B,让他做出C;明天只给他文字描述,让他从零开始;后天给他C和文字描述,让他反推出A……这样训练出来的厨师,面对任何输入组合都能应对自如。

SCM 做的正是这件事。在每次训练时,它随机把所有视觉模态(比如颜色图、光照图、法线图等)分成两堆:一堆作为"已知条件",保持干净、完整;另一堆作为"需要学习生成的目标",被加入噪声(就像把答案涂掉,强迫模型去推断)。每次训练,哪些模态是已知的,哪些是需要生成的,都是随机决定的。甚至"已知条件"这堆可以是空的——那就意味着模型必须仅凭文字描述来生成一切。

这种设计在技术上通过"时间步操纵"来实现:目标模态在不同时间步被逐渐去噪,条件模态则被固定在"完全干净"的状态(相当于时间步为1),作为生成过程的锚点。最终的训练目标是让模型学会预测噪声到干净图像的变化方向,专门针对那些被设定为"目标"的模态。

这个设计的精妙之处在于,它用一套统一的机制同时覆盖了三大类任务:只给文字的"文字→视觉"生成、给视觉条件的"视觉→视觉"转换,以及文字和视觉都给的"文字加视觉→视觉"条件生成。推理时,只需按照具体任务决定哪些模态作为输入条件、哪些模态从噪声开始生成即可。

四、"解耦门控LoRA":既不乱、又不忘

第二个核心设计叫做"解耦门控LoRA"(Decoupled Gated LoRA,DGL)。要理解它,需要先理解两个问题:为什么需要"解耦",为什么需要"门控"。

关于"解耦",考虑这样一个场景:你要训练一个人同时精通中文书法和英文打字。如果你让他用同一块"大脑记忆区"同时存储这两种技能,中文毛笔的柔和弧线感和英文键盘的机械节奏感会互相干扰,导致两种技能都学得不彻底。更好的方式是让他为每种技能建立独立的"肌肉记忆",中文书法一套,英文打字一套,互不干扰。

在这里,不同的视觉模态(颜色图、光照图、法线图、透明度图等)各自有截然不同的数据分布和视觉特征。如果用一个共享的参数集来处理所有模态,就像让同一块记忆区同时记住书法和打字——不同模态之间会产生"破坏性干扰",导致所有模态都学不好。DGL 的解决方案是给每个模态配备独立的 LoRA 模块。LoRA 是一种参数高效的调整技术(由微软研究院提出),它用两个小矩阵的乘积来代表对大模型的更新,参数量极少但效果显著。每个模态有自己专属的 LoRA,各管各的参数空间,互不侵犯。

关于"门控",则解决另一个问题:当某个模态作为"已知条件"输入时,模型需要尽可能精准地读取和理解这个模态的内容,这时候最好直接使用原始骨干模型的能力,因为那个能力是在海量数据上训练出来的,非常强大和稳定。如果这时候把该模态的 LoRA 也激活,反而会给骨干模型的编码能力引入干扰,就像你在安静阅读时突然有人在旁边放音乐,即便那音乐单独听很好听,此时也是一种干扰。

所以 DGL 设计了一个"门":当某个模态是"需要生成的目标"时,它对应的 LoRA 打开,帮助模型学习生成该模态特有的统计规律;当某个模态是"已知条件"时,它对应的 LoRA 关闭,让骨干模型的原生编码能力充分发挥。

研究团队在消融实验中严格验证了这两个设计的必要性。他们设计了一个"共享LoRA"的对比版本(为了公平,还把共享LoRA的秩设为64,是各模态独立LoRA秩32的两倍,以保证参数量相同),同时给不同模态加上了不同的位置编码来做区分。结果是:共享参数的版本在注意力图上显示出明显的前景-背景特征泄露,前景分支和背景分支的关注区域混乱重叠;而完整的DGL版本则显示出清晰的模态分离——颜色图分支关注全局,前景分支精准锁定主体,背景分支干净地覆盖环境。同样地,关掉门控机制后,法线估计质量明显下滑,积雪地面的法线变得不准确,木棍等细节也出现纹理丢失。

五、"跨模态自注意力":让各图层相互"说话"

第三个核心设计叫做"跨模态自注意力"(Cross-Modal Self-Attention,CMSA)。

在 UniVidX 中,来自不同模态的视频数据沿批次维度拼接,一起喂给同一个扩散模型处理。但是,普通的注意力机制(这是现代深度学习模型内部信息交流的核心机制)在默认情况下,每个模态只跟自身的数据打交道,不跨模态交流。这就像一个多语言翻译团队,中文组只跟中文组开会,英文组只跟英文组开会,日文组只跟日文组开会——各自翻译出来的内容可能互相对不上,同一个场景在不同翻译版本里描述的细节可能相互矛盾。

CMSA 的设计思路是:保持每个模态自己的"提问"方式(在注意力机制里叫做"查询",Query),但让所有模态共享同一套"关键词"和"答案"(在注意力机制里叫做"键"和"值",Key和Value)。具体来说,把所有模态的键和值拼接起来形成一个共享的上下文池,然后每个模态用自己的查询去这个共享池里检索信息。

这样一来,当模型在生成法线图的某个区域时,它可以直接"参考"颜色图在同一区域的内容,从而确保法线图和颜色图描述的是同一个物体的同一个面。这种跨模态的信息共享,从机制上保证了各模态之间的一致性,避免了用多个独立模型串行处理时必然出现的"各说各话"问题。

消融实验同样验证了CMSA的价值。用普通注意力替换CMSA后,在文字到本征图生成任务中,宇航员的颜色图、光照图、法线图之间出现了明显的结构不一致和细节错位(比如宇航员头盔的反光在不同模态图里对应不上);完整的CMSA版本则在所有模态间保持了精确的对齐。

六、两个真实模型:UniVid-Intrinsic 和 UniVid-Alpha

研究团队用两个具体的模型实例来验证 UniVidX 框架的有效性。

第一个是 **UniVid-Intrinsic**,专注于"视频的本征分解"领域。所谓本征分解,就是把一段视频分解为三个物理层面的分量:首先是"反照率"(Albedo),也就是物体表面固有的颜色,不受光照影响,一个红苹果无论在强光还是弱光下,它的反照率始终是红色;其次是"辐照度"(Irradiance),也就是场景中的光照分布,包括阴影、高光、环境光等,它反映了光线照射的状态而不是物体本身的颜色;第三是"法线图"(Normal),也就是每个像素点的表面朝向信息,一张脸上的法线图会显示鼻梁朝前、脸颊朝两侧、额头朝上,这是三维几何结构的二维表达。

值得一提的是,团队刻意不包括粗糙度和金属度(虽然这些是完整物理渲染方程的一部分),原因有二:一是这类标注数据极难获取且噪声大;二是大型视频扩散模型已经在海量数据中隐性地学会了材质推断,无需显式参数化。深度图也被排除,因为法线图已经捕捉了局部几何细节,而深度主要描述宏观几何,与光照计算的关系没那么直接。

为了训练这个模型,团队从 SuperHiveMarket 平台精选了167个高质量三维室内场景,用 Blender 软件配合 Cycles 路径追踪引擎(128次采样)渲染生成了924段视频片段,每段21帧,分辨率480×640,同时附带精确的反照率、辐照度、法线图标注,全部以16位浮点OpenEXR格式保存以保持完整的物理精度。其中900段用于训练,24段用于测试,整个数据集命名为 InteriorVid。

第二个是 **UniVid-Alpha**,专注于"视频的图层分解"领域,类似于专业视频编辑中的"抠图"和"图层合成"。它处理四个分量:混合视频(Blended,BL,就是我们看到的普通视频)、前景图层(Foreground,FG,主体人物或物体的颜色纹理)、透明度遮罩(Alpha,每个像素的透明程度,决定前景如何与背景融合)、背景图层(Background,BG,去掉前景后的干净背景)。

一个有趣的技术细节是:透明度图(Alpha)本质上是单通道的(只有一个数值,0是完全透明,1是完全不透明),但骨干模型的VAE编码器需要三通道的RGB输入。解决方案很简单——把透明度值复制三份,变成"灰度RGB"再送入VAE,这样就能在不改动编码器结构的情况下处理透明度信息。另一个设计亮点是:背景图层不是简单地"挖空"前景区域,而是训练模型自动"脑补"被前景遮挡的区域,生成一个完整的、没有遮挡痕迹的背景——这正是借助了大型视频扩散模型强大的图像补全先验能力。

UniVid-Alpha 的训练数据来自 VideoMatte240K,这是一个专注于人体前景的视频抠图数据集,团队从中选用了484段视频,分辨率调整至432×768,并使用 Qwen3-VL 大型视觉语言模型为每段视频自动生成文字描述。

两个模型共享相同的训练配置:基于 Wan2.1-T2V-14B 骨干,每个模态的LoRA秩为32,总可训练参数量3.85亿,使用 AdamW 优化器(初始学习率0.0001,衰减至0.000001),在4块 NVIDIA H100 GPU 上以BF16精度训练,UniVid-Intrinsic 训练6000步,UniVid-Alpha 训练5000步。

七、实验结果:与行业最好的方法正面比拼

研究团队针对多个任务进行了严格的量化对比实验,结果印证了框架设计的有效性。

在"文字生成本征视频"任务上,他们与 IntrinsiX(来自慕尼黑工业大学,发表于 NeurIPS 2025 的专门生成本征图像的模型)进行比较。不过需要注意,IntrinsiX 只能生成静态图像,而 UniVid-Intrinsic 生成的是视频序列。评估方式是邀请用户对生成结果进行1到10分的打分,同时用 VBench 的"时间闪烁"指标衡量视频的时间稳定性。UniVid-Intrinsic 在视觉质量、文字对齐度、模态一致性上的用户评分全面领先(RGB 得分9.34对7.82,模态一致性9.29对7.02),时间稳定性接近满分的0.9876。从视觉上看,IntrinsiX 在模态之间常有明显的结构错位(比如颜色图里有的细节在法线图里完全对不上位置),而 UniVid-Intrinsic 生成的视频在所有模态间保持精确对齐,并且能捕捉精细纹理,比如猫的皮毛在颜色图和法线图里都能精确呈现。

在"逆向渲染和正向渲染"任务上(即给定RGB视频,分解出各本征分量;或给定本征分量,重建RGB视频),UniVid-Intrinsic 在 InteriorVid-Test 基准上超越了包括 RGB<->X、Diffusion Renderer(英伟达研究院)、Ouroboros 等多个专业对比方法。在反照率估计上,PSNR 达到16.89分贝(第二名 Ouroboros 为14.21);辐照度估计的 PSNR 达到13.46(第二名 RGB<->X 为11.29);法线估计的均值角度误差(MAE)降至11.09度,而专门做法线估计的 Stable Normal 是13.68度、Lotus 是14.51度,视频专用的 NormalCrafter 是12.49度——UniVidX 作为一个"什么都做"的通用模型,在这个专项指标上居然比专门模型还好。

在"真实世界反照率估计"上,研究团队使用了 MAW(Measured Albedo in the Wild)基准数据集,其中包含850张真实场景照片,每张都有通过灰卡测量的精确反照率标注。UniVid-Intrinsic 达到最佳强度误差0.44(越低越好),色度误差3.60,均位列所有对比方法的前三甲。值得强调的是,模型完全在合成室内数据上训练,却能迁移到真实世界场景,这正体现了大型视频扩散模型先验知识的泛化能力。

在专项法线估计的 Sintel 基准测试上,与 DSINE、GeoWizard、GenPercept、Stable-Normal、Marigold-E2E-FT、Lotus、NormalCrafter 七个专业方法对比,UniVid-Intrinsic 以仅19000帧的训练数据,达到了与排名前三的专业方法相当的水平,而排名第一的 NormalCrafter 使用了86万帧训练数据,是 UniVidX 的45倍以上。

在"文字生成RGBA视频"任务上,与 LayerDiffuse(斯坦福大学,只能生成静态图像)对比,UniVid-Alpha 的用户评分全面领先,时间稳定性同样接近满分(0.9912)。一个值得关注的细节是:LayerDiffuse 需要给前景、背景、混合图分别提供不同的文字描述才能保证图层分离质量;而 UniVid-Alpha 用同一段文字描述就能获得高质量的图层分离,这直接体现了 DGL 解耦设计的价值——不同模态有独立的参数空间,天然就能从同一输入中区分出不同的语义层次。

在"视频抠图"任务上,UniVid-Alpha 在 VideoMatte 基准上的表现令人印象深刻——它不仅超越了 RVM、MODNet、VMFormer 等无辅助输入的方法,甚至超越了需要提供额外分割遮罩作为辅助输入的 AdaM、FTP-VM、MaGGIe、MatAnyone 等"有利"方法,在 MAD(均值绝对差)指标上达到最低的4.24,在 MSE、Grad、dtSSD 指标上也全部第一或第二。在视觉上,对于多人同框、复杂背景(如墙壁上的灯具、精细发丝)的场景,其他方法出现了明显的背景渗漏和伪影,UniVid-Alpha 则生成了干净精准的遮罩。

八、多条件感知的独特价值:当单一信息不够用时

UniVidX 的灵活性带来了一个传统单任务模型无法实现的能力:多条件感知路径。

简单来说,要推断同一个目标(比如法线图),你可以只给 RGB 视频作为输入,也可以同时给 RGB 加上反照率图作为输入。当场景中有模糊、远距离或信息不足的区域时,仅靠 RGB 往往无法准确判断——比如在画面中远处有一个模糊的行星,模型可能会错误地把它当成天空背景忽略掉,从而在法线图中那个位置填上"空气"的法线方向而非行星表面的法线方向。

但如果同时提供了反照率图,那张图会清楚地显示行星的物质颜色,告诉模型"这里确实有一个固体表面",模型就能以反照率作为结构约束,正确地在法线图中还原行星表面的朝向。这就像一个侦探,仅凭现场照片可能猜不准某个角落里是人影还是道具,但如果同时有红外热成像的数据,就能准确区分有生命的人和无生命的道具。

这一特性对于处理本征渲染中固有的"病态问题"(即同一组RGB像素可以对应无数种光照-材质组合)尤其有价值,提供辅助模态相当于给这个病态问题引入了额外的约束,使解更加确定。

九、组合不同任务,实现更复杂的应用

UniVidX 的另一个实际价值体现在:通过组合不同任务,可以实现一系列以往需要专业软件和手工操作才能完成的视频效果。

视频重新打光是其中最有代表性的应用。首先对输入视频做逆向渲染,得到反照率和法线图;然后把这两个图层作为条件,输入新的光照文字描述(比如"月光下的夜晚"),模型就能生成重新打光的视频和对应的辐照度图。反照率保证了物体颜色不变,法线保证了几何结构不变,只有光照被替换成了新的效果。

文字驱动的视频换纹理则是另一种组合:先从文字描述生成一套本征图,然后固定其中的辐照度(保持光照)和法线(保持几何),仅用新的文字描述重新生成颜色图和反照率——这样就实现了改变外观但保留光照和形态的效果,比如把卡通企鹅的外套从黑色换成蓝色。

材质编辑则更进一步:先分解真实视频,手动修改反照率(改颜色)和法线图(改表面细节纹理),然后把编辑后的图层加上原始辐照度重新输入模型,得到修改了材质的新视频。

在 UniVid-Alpha 方面,视频补绘(Inpainting)的流程是:先把输入视频分解出透明度遮罩和背景,再以这两者加上新的文字描述为条件,让模型生成新的前景内容和最终混合视频——实现了在精确保留背景和主体轮廓边界的前提下,替换主体的外观。背景替换则是先从文字生成前景和遮罩,再以这些加上新背景描述来生成背景和最终合成结果。前景替换则反过来:先抠出背景,以背景加上新主体描述为条件,生成新的前景、遮罩和合成视频。

十、诚实面对局限:玻璃、透明物和分开训练的遗憾

研究团队在论文中诚实地讨论了当前版本的局限性,这体现了科学研究应有的严谨态度。

一个有趣的失败案例发生在 UniVid-Intrinsic 对透明玻璃材质的法线估计上。在一个包含多块玻璃的室内场景中,模型成功地估计了靠近画面边缘的夹娃娃机玻璃外壳的法线(平面朝向),却对画面中央的另一个玻璃罩估计失败,错误地穿透玻璃"看到了"内部物体并把内部的曲面法线映射到了本应是平玻璃的位置。两者都是玻璃,为何一个成功一个失败?研究团队的分析是:训练数据 InteriorVid 中,画面边缘区域统计上多为平面墙体,而画面中央多为摆放了复杂物体的区域——模型学到了这种空间位置偏差,并在推断时错误地套用了"画面中央应该有高频几何"的先验。这说明模型确实具备识别和处理玻璃材质的能力(否则边缘那块也会失败),只是受到了训练数据的空间分布偏差影响。

UniVid-Alpha 也有类似的案例:在文字生成RGBA任务中,生成的冰块图像确实正确地显示了背景光线穿透冰块折射的效果(说明模型理解了透明物体的物理行为),但对应的透明度遮罩却是完全不透明的纯白色(Alpha=1.0),没有生成应有的半透明数值。原因同样是数据偏差:VideoMatte240K 训练集以人体前景为主,几乎没有透明或半透明物体的标注样本,模型从未见过"Alpha应该是小于1的某个中间值"的训练样本,自然无从学习。

研究团队认为,这些问题本质上不是架构缺陷,而是数据覆盖不足,补充相应类型的训练样本即可解决。骨干模型的物理先验已经具备处理这些情况的能力,只差任务特定的微调数据来"激活"这种能力。

另一个客观限制是计算资源约束:140亿参数的骨干模型内存占用极大,这导致当前版本只能同时处理最多4个模态,视频不超过21帧,分辨率限制在480p。此外,由于缺少同时包含本征标注和图层分解标注的联合数据集,本征分解能力(UniVid-Intrinsic)和图层分解能力(UniVid-Alpha)目前被分成了两个独立模型,研究团队认为理论上可以合并为一个,只要有合适的联合标注数据。

归根结底,UniVidX 提供的不只是两个具体的模型,而是一套可复用的设计思路:随机条件遮蔽让一个模型具备"任意排列组合"的灵活性,解耦门控LoRA让适配不同模态时互不干扰而且不破坏原有能力,跨模态自注意力让同时生成的多个图层天然保持自洽一致。这套组合拳,加上大型视频扩散模型积累的丰富世界知识作为底座,使得用极少的训练数据就能在陌生场景上取得可观的效果成为现实。对于从事影视制作、游戏开发、虚拟现实、工业仿真等领域的工程师和研究者来说,这个框架提供了一种比"为每个任务单独训练一个模型"更高效、更灵活的技术路线,有兴趣深入了解的读者可以通过 DOI: 10.1145/3811304 查阅完整论文,或访问该项目的主页获取演示视频和代码。

Q&A

Q1:UniVidX 为什么能用不到一千段视频训练就泛化到各种真实场景?

A:UniVidX 的核心策略是在已经在海量视频数据上预训练好的 Wan2.1-T2V-14B(140亿参数的大型视频扩散模型)基础上进行轻量改造,而不是从零开始训练。这个骨干模型已经隐性学会了物理世界的大量规律,UniVidX 的训练只是"引导"这些先验知识朝特定任务方向输出,而非重新学习世界。加上解耦门控LoRA设计有效防止了新知识破坏原有能力,使得少量任务数据就足以完成定向适配。

Q2:UniVid-Alpha 视频抠图为什么不需要用户提供分割遮罩就能超过需要遮罩的方法?

A:UniVid-Alpha 通过跨模态自注意力机制让透明度遮罩(Alpha)的生成过程直接参考颜色图的全局语义信息,同时大型视频扩散模型本身就积累了强大的语义分割先验——它从海量视频中隐性学会了"人物"和"背景"的区别。这两点结合,使模型在没有任何额外标注的情况下,就能做出比依赖分割遮罩辅助的传统方法更准确的抠图,特别是在精细发丝和复杂背景这类难点区域。

Q3:UniVidX 的跨模态自注意力和普通注意力有什么实际区别?

A:普通注意力让颜色图只"看"颜色图自己的信息,法线图只"看"法线图自己的信息,各模态信息完全隔离,最终可能出现同一场景的颜色图和法线图相互矛盾的情况。跨模态自注意力则让所有模态共享一个信息池——颜色图在生成时可以参考法线图的结构信息,法线图也可以参考颜色图的纹理细节,从机制上保证了多个模态同步生成时的内容自洽,避免了用多个独立模型串行处理时的误差累积问题。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-