微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 中科大与腾讯混元联手打造"悟空":这套视频编辑神器,能让狗狗"戴帽子"还能让镜头"会跑路"

中科大与腾讯混元联手打造"悟空":这套视频编辑神器,能让狗狗"戴帽子"还能让镜头"会跑路"

2026-07-08 09:19
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-08 09:19 科技行者

这项由中国科学技术大学与腾讯混元联合开展的研究,以arXiv预印本形式发布于2026年6月,论文编号为arXiv:2606.30599。对视频编辑、AI生成内容感兴趣的读者,可以通过这个编号在arXiv平台上查阅完整原文。

你有没有想过,把手机里一段普通视频,用一句话指令就能变成另一个样子?比如对着视频说:"把那只狗头向右移动一点",或者"把镜头往左摇",再或者"把画面变成迪士尼动画风格,同时给狗狗加一顶黄色棒球帽"——这些指令,机器能听懂并且真的做到吗?

这正是"基于指令的视频编辑"这个研究方向想要解决的问题。而这篇论文的核心贡献,就是搭建了一套完整的"视频编辑工厂":数据集叫Goku(中文名"悟空",寓意神通广大),模型叫Goku-Edit,评测标准叫Goku-Bench。三件套合在一起,试图把视频编辑从"只能改颜色、换风格"这种初级水平,推向"能控制镜头运动、能挪动主体位置、能同时完成多项改动"的高级境界。

一、从"换件衣服"到"挪个位置",视频编辑的真正难关在哪里

在聊这套系统的具体构造之前,有必要先理解一个关键背景:现有的视频编辑研究,基本上停留在"换件衣服"的水平。

所谓"换件衣服",是指目前绝大多数视频编辑数据集和模型,只能做一些外观上的变化——比如把蓝色天空换成夕阳,把一个人的红色上衣改成白色,或者把整段视频变成素描风格。这些操作有个共同特点:视频里的人、物、背景的位置和运动方式完全不变,只是"涂了层新漆"。

而现实生活中,人们对视频编辑的需求远比这复杂。专业导演希望改变镜头运动方向,内容创作者希望把画面里的主体挪到另一个位置,电商从业者希望把参考图片里的产品"贴进"视频场景,还有很多人希望同时完成好几件事——比如既换风格,又删掉某个物体,还要改变某人的动作。这些需求,现有的数据集和模型统统搞不定。

问题的根源不是模型能力不够,而是根本没有足够的"训练素材"。训练AI模型,需要大量"原视频+改动指令+改动后视频"的配对样本。现有的数据集,要么规模太小,要么任务太单一,要么质量参差不齐——就像你想练厨艺,但只有几道炒青菜的菜谱,自然做不出满汉全席。

正是为了填补这个空缺,中科大和腾讯混元团队着手构建了Goku数据集。

二、两百万对样本,十大任务类别,Goku数据集是怎么炼成的

Goku数据集最终包含200万对高质量的视频编辑样本,覆盖十个核心任务类别。这十类任务被分为两大阵营:基础编辑和复杂编辑。

基础编辑涵盖五种类型:在视频中添加物体(Add)、去除视频中的物体(Remove)、把某个物体换成另一个(Swap)、改变某个物体的属性比如颜色或大小(Alter),以及把整段视频转换成某种艺术风格(Style Transfer)。这五类相对成熟,现有研究已有涉及,但Goku对其质量标准做了大幅提升。

复杂编辑则是这次真正的创新地带,包含五种类型:镜头运动(Camera Movement,比如镜头向左平移、推进、拉远),主体运动(Subject Movement,比如把视频里的猫的头部向右移,或者让一个在走路的人改成跑步),基于参考图像的添加(Reference Add,把参考图片里的某个人物添加到视频指定位置),基于参考图像的替换(Reference Swap,用参考图片里某件衣服替换视频里另一件),以及多任务编辑(Multi-Task Edit,同时执行两到五项不同类型的编辑操作)。

要在单个数据集里同时做好这十类任务,背后需要一套精心设计的数据生成流水线。

这套流水线分三个大阶段运作,整体逻辑类似工厂的"原料采购—加工生产—质量检验"。

原料来自于Koala-36M,这是一个现有的大规模视频数据集。团队从中筛选出100万段高质量视频片段,应用了镜头切换检测、美学评分、运动幅度分析、水印去除等一系列自动化过滤手段,再由Gemini 2.5 Pro(谷歌的多模态大模型)做内容丰富度审核,最终每段视频被裁剪为3到10秒,保留画面连贯、内容清晰的片段。

有了原料之后,就要生成编辑指令。团队让Gemini 2.5 Pro分析每段视频的内容,为每种任务类别自动生成自然语言形式的编辑指令,同时输出结构化的对象标签。举例来说,对于一段有一只猫坐在地毯上的视频,模型可能生成"把地毯从红色改为蓝色"这样的Alter任务指令,或者"移除画面中的猫"这样的Remove任务指令。风格迁移任务覆盖超过100种风格,镜头运动任务覆盖超过20种运动模式,可编辑的对象类别超过200种。

有了指令之后,就要实际生成编辑后的视频。针对不同任务,团队使用了不同的专门工具,但有一个贯穿始终的原则:把复杂任务分解成可以单独处理的子问题,再逐步拼合。

对于去除和添加任务,团队使用了Minimax-Remover这个工具来做对象去除,获得干净的Remove样本;然后把原始视频和去除后的视频"角色互换",就得到了自然的Add样本——这种"一套操作、两份数据"的思路,极大提升了效率。

对于替换和属性修改任务,团队先用Grounded-SAM2提取视频里目标对象的时序遮罩(可以理解为每一帧里目标对象的精确轮廓),再用Flux生成参考图像,最后把这些信息一起送入VACE这个视频创作与编辑工具,在遮罩框定的区域内完成替换或属性修改,其余区域保持不动。

对于风格迁移任务,直接对整段视频做风格化处理容易导致帧间闪烁和风格漂移。团队的解决方案是拆分为三步:先用Flux对第一帧做风格化处理,再提取每一帧的深度图作为几何约束,最后把风格化的第一帧与深度序列一起输入VACE,沿时间轴传播风格,同时借助深度图保持场景的空间结构不变。

对于主体运动任务,团队进一步将其拆分为"动作变化"和"位置变化"两个子问题分别处理。动作变化的做法是:让Gemini 2.5 Pro为同一主体生成两种不同的动作描述,比如"走路"变"跑步",然后用Wan2.2(腾讯开发的视频生成模型)分别合成两段视频,得到主体外观一致、背景相同、但动作不同的配对数据。位置变化的做法是:先用Flux在单帧图片上把目标对象挪到新的位置,再用Wan2.2以这张修改后的图片为首帧,向后生成一段时间连贯的视频——这样就把"视频级别的对象挪位"这个超级难题,拆解成了"图像级别的对象挪位"加上"图像转视频"两个相对可控的子问题。

对于镜头运动任务,团队借助RecamMaster工具,根据Gemini 2.5 Pro生成的指令和场景描述合成镜头运动视频对。遇到"先左移再推进"这类复合镜头运动,同样拆解为多个基础运动类型的顺序组合。

对于多任务编辑,则是把上述各单任务的流水线串联起来,前一个任务的输出作为下一个任务的输入,逐步叠加完成全部编辑操作。

对于基于参考图像的编辑,存在一个特殊挑战:如果直接用从视频中裁取的目标区域图像作为参考,模型可能退化成像素级别的直接复制粘贴,而不是真正"理解"参考图像并融合到视频中。为此,团队用Flux对参考图像进行重新绘制,并加入了姿态偏移、光线变化和背景替换等扰动,让模型必须真正理解参考图像的语义内容,而非机械复制。

三、严苛的三重质检关卡:88%的生成结果被淘汰

生产过程中,任何一个环节出了问题,都可能让最终数据变得一文不值。为此,团队建立了一套"三重质检"系统,贯穿整个流水线。

第一重质检发生在原料筛选阶段。100万段视频在进入后续流程之前,已经历了美学评分、运动分析、镜头切换检测和水印去除,再加上Gemini 2.5 Pro的内容丰富度审查,确保每段源视频都是高质量的起点。

第二重质检发生在数据生成之前的条件验证阶段。在正式执行昂贵的视频生成操作之前,团队会验证所有中间结果的质量。具体来说,遮罩的完整性通过IoU(交并比)阈值来评估;Gemini 2.5 Pro负责核查编辑目标与指令之间的语义一致性;合成参考图像的视觉合理性也会被逐一检验。任何一项不达标,整个样本直接丢弃,不浪费后续的计算资源。

第三重质检发生在视频生成完成之后。每一对最终的编辑样本都要经历双层评估:低层视觉质量层面,执行帧间一致性检查、频域伪影检测和美学重新评分;语义层面,Gemini 2.5 Pro评估编辑准确性和真实感。这套系统极度严苛,大约88%的生成样本会被淘汰——换句话说,为了得到200万对高质量数据,团队实际生成了远超这个数量的样本,其中绝大多数都被筛掉了。

这种宁缺毋滥的做法,正是Goku与其他数据集的核心区别之一。

四、Goku-Edit模型:让主脑"看懂"指令,让副脑"管好"边界

有了高质量的数据集,接下来的问题是:用什么样的模型架构来充分利用这些数据?

Goku-Edit的设计围绕三个核心创新展开,可以把它理解为一个"主脑加副脑"的双人协作系统,加上一套让两者精准沟通的语言,再加上一种强化空间感知的训练推理策略。

主脑负责生成编辑后的视频,副脑负责预测"哪些地方需要被改动"的遮罩。两个分支都基于同一个预训练底座:Wan2.2-5B,这是腾讯开源的50亿参数视频生成模型。

主脑接收的输入包括:文本提示、源视频、参考图像。副脑接收的输入包括:文本提示、空间分辨率降低了n倍的源视频(默认n=4,即宽高各缩减为原来的四分之一)。为了让模型更深刻地理解复杂的编辑指令,团队在两个分支中都使用了Qwen3VL-8B(阿里巴巴的80亿参数多模态大模型)来处理文本,而不是传统的CLIP或T5这类相对简单的文本编码器。多模态大模型对自然语言的理解能力,使得模型能更好地分解和执行"同时把天空换成夕阳,同时在水面上加一艘船"这样的复合指令。

两个分支之间通过交叉注意力机制相互沟通。但这里有一个棘手的问题:副脑以低分辨率运行(1/n的空间尺寸),而主脑以全分辨率运行,两者的"坐标系"不一致。如果直接让两者做注意力计算,就好比一张城市地图和一张缩略图混在一起找对应位置,标注肯定会错位。

为了解决这个坐标系不一致的问题,团队提出了RoPE对齐空间交叉注意力机制。RoPE是一种在大语言模型中广泛使用的位置编码方式,它通过旋转矩阵把位置信息编码进向量的相位中,使得注意力权重能体现两个位置之间的相对距离。团队的解决方案简洁而有效:在做交叉注意力之前,把副脑的坐标指标乘以n,把低分辨率的坐标映射到高分辨率的坐标空间里。这样,副脑中坐标为(x, y)的遮罩标记,就被映射到了高分辨率坐标系中的(nx, ny),与主脑中对应的视频标记的坐标系对齐。空间上重合的位置不再有相对偏移,不重合的位置之间的偏移量也与它们真实的物理距离成正比,保留了RoPE的局部性偏好。

主脑和副脑之间的信息流动是双向的。遮罩到视频方向的注意力(M2V),让主脑获得副脑提供的空间约束信号;视频到遮罩方向的注意力(V2M),让副脑根据主脑当前的去噪状态来更新自己的遮罩预测。后者之所以重要,是因为如果副脑只看输入的源视频,对主脑的生成状态一无所知,那么随着去噪过程的推进,副脑预测的遮罩就会与主脑正在生成的内容逐渐脱节,导致边界抖动和不连贯。双向通信让两个分支保持实时同步,协同完成编辑。

除了训练阶段的双分支架构,团队还设计了一种只在推理阶段使用的增强策略:空间增强CFG(SpatialCFG)。这个策略的灵感来源于标准CFG(无分类器引导),标准CFG通过对比"有文本条件"和"无文本条件"的预测,来放大文本描述对生成内容的影响。SpatialCFG的做法是:在推理时运行两次前向计算,一次启用双向交叉注意力(主副脑互联状态),一次禁用交叉注意力(主副脑各自独立运行,对方输入替换为空白);然后把两次预测的差值乘以一个放大系数,加回到独立运行的预测上。这样,交叉注意力带来的空间约束信号被额外放大,帮助模型更严格地将编辑范围控制在遮罩区域内,减少"编辑溢出"到不该改动的区域的情况。SpatialCFG与标准文本CFG可以独立叠加使用,在推理时完全不需要额外训练。

五、Goku-Bench:1000个测试案例,7个专属指标,给视频编辑打出"专业分"

光有好的数据和好的模型还不够,还需要一套公正的评测标准。现有的视频编辑评测集大多只覆盖单一外观编辑任务,根本无法衡量模型处理复杂编辑的能力——就像只用"速度测试"来评判一辆车,却不测它的转弯、载重和安全性。

Goku-Bench包含1000个精心筛选的测试视频,覆盖多人场景、全身和半身人物、各类动物(狗、猫、鲨鱼、鸟等)、常见物体(服装、车辆、建筑等)和自然景观(山川、河流、沙漠等)。特别的是,测试集专门纳入了低光照、快速运动主体、明显摄像机抖动等高难度拍摄条件,以及主体运动和多任务联合编辑这些在其他评测集中几乎缺席的场景,确保足够的多样性和挑战度。所有测试案例的编辑指令均由人工撰写,而非自动生成,保证指令的多样性、准确性和适当难度。

评测指标分为两类:从VBench借鉴的通用视频质量指标,以及团队自行设计的7个编辑专属指标。

通用质量指标包括背景一致性(BC)、CLIP相似度(CLIP)、帧德瓦-费舍尔距离(FVD,衡量生成视频与真实视频分布的差距)、时间连贯性(TC)、运动流畅度(MS)和美学评分(AES)。

7个编辑专属指标中,有4个是通用编辑能力指标,全部以Gemini 2.5 Pro作为评判模型,按照预设的评分标准自动打分。物理规律保真度(PR)评估编辑结果是否符合现实世界的物理法则,比如运动的合理性和物体交互的真实感。空间关系准确度(SR)评估主体与背景的空间排布是否严格遵循了编辑指令的描述。指令跟随度(IF)全面评估模型执行复杂多任务编辑指令的完整程度。整体编辑质量(EQ)从视觉自然度和编辑一致性两个维度做综合评分。

另外3个是针对特定任务的专项指标。主体运动指标(SuM)用Gemini 2.5 Pro评估主体运动轨迹的真实感和流畅度,与PR的区别在于:PR评估的是整体物理合理性,SuM专门聚焦主体自身的运动轨迹。镜头运动指标(CM)利用光流分析来识别并评估视频帧间的运动类型,判断实际生成的镜头运动与指令是否匹配。风格迁移指标(ST)计算参考风格图像与生成视频帧之间的DINO特征相似度,量化风格迁移的准确程度。

六、实验结果:Goku-Edit在哪些地方领先,在哪些地方还有差距

在Goku-Bench上的量化对比实验覆盖了多个开源和闭源方法。开源方法包括TokenFlow、InsV2V、StableV2V、InsViE、AnyV2V、Omni-Video和LucyEdit;闭源商业方法包括Runway Gen-4和Luma Ray3。

在绝大多数指标上,Goku-Edit是所有开源方法中表现最好的。背景一致性达到0.969,在开源模型中最高;FVD降至993.93,在开源模型中最低,说明生成的视频与真实视频分布最接近;时间连贯性0.955,风格迁移得分0.955,主体运动得分0.633,镜头运动得分0.927,物理保真度0.738,空间关系准确度0.832,指令跟随度0.627,整体编辑质量0.645,这些关键编辑能力指标全面超越其他开源方法。

与Runway Gen-4和Luma Ray3这类闭源商业模型相比,Goku-Edit在CLIP相似度、运动流畅度和美学评分这几项"视觉观感"指标上仍有差距,毕竟商业公司在感知质量上投入了大量人力和计算资源。但在物理保真度(PR)、空间关系准确度(SR)、镜头运动(CM)和主体运动(SuM)这些"能不能真正执行结构性编辑"的指标上,Goku-Edit的得分甚至超越了两款商业模型,体现了专注于结构性和多任务编辑带来的独特优势。

参考图像引导编辑的结果同样有意思:Goku-Edit的参考图像一致性得分(SC)为0.54,整体编辑质量0.824,全面领先于StableV2V和AnyV2V等开源对手,并与两款商业模型基本持平甚至略有超越。

定性比较也印证了这一点。在镜头运动任务中,InsV2V、InsViE、Omni-Video和LucyEdit基本无法产生任何有效的镜头运动,而Goku-Edit能正确执行平移操作,并合理地填补新露出的区域。在精确去除任务中,其他方法在定位目标区域时容易损伤周边内容,Goku-Edit则能精确定位并完整去除目标,同时保持背景完好。在多任务编辑中,其他方法普遍无法同时完成所有子任务,而Goku-Edit能准确执行全部指令并维持整体视频质量。在参考图像引导编辑中,Goku-Edit在确定放置位置和保持与参考图像外观一致性方面,也明显优于其他开源方法。

消融实验部分,团队系统验证了每个设计选择的贡献。用多模态大模型作为文本编码器,将IF从0.541提升到0.573;加入双分支架构,PR和SR分别再提升0.031和0.033;引入RoPE对齐,SR进一步从0.789提升到0.819;最后加上SpatialCFG,PR再涨0.020,IF再涨0.019,达到全部组件开启时的最优水平。空间下采样因子n的消融实验显示,n=1时两个分支耦合过紧,纹理细节不足;n=4时纹理完整、定位精确;n=8时结构信号退化,定位失败,因此n=4被选为默认值。

在训练数据的消融实验中,团队让同一个网络架构(LucyEdit)分别在InsV2V数据集、InsViE数据集、Senorita数据集和Goku数据集(各50k样本)上训练,在Goku-Bench上评测。结果显示:在IF和EQ这两个最能体现复杂编辑能力的指标上,其他数据集训练出的模型得分普遍在0.25-0.30之间,而在未过滤的Goku上训练的模型已经达到0.318和0.331,在经过完整过滤的Goku上训练的模型进一步跃升至0.501和0.522。将训练规模从50k扩展到100k,所有指标继续提升,说明Goku带来的收益尚未饱和,持续扩大数据规模仍然有益。

用户研究由30名参与者对100段视频按五分制进行评分,覆盖指令跟随、视频质量和时间连贯三个维度。Goku-Edit在三项中均排名第一,其中在保留非编辑区域和处理复杂运动指令方面的优势尤为突出。

归根结底,Goku这套"悟空"系统做的事,是把视频编辑这件事的上限大幅往上推了一推。200万对涵盖十类任务的高质量训练数据,解决了"没东西可学"的问题;双分支加多模态语言模型的Goku-Edit,解决了"看不懂指令、控不准空间"的问题;1000个案例加7个专属指标的Goku-Bench,解决了"无法公正衡量"的问题。在感知质量上与顶级商业模型的差距依然存在,结构性编辑任务上已经展现出独特的竞争力,这是一个很有意思的起点。

对视频编辑、多模态AI或者生成式内容创作感兴趣的读者,可以在arXiv上通过论文编号arXiv:2606.30599查阅完整的原文和补充材料,里面包含更多的可视化结果和消融实验细节。

Q&A

Q1:Goku数据集和其他视频编辑数据集相比,最大的区别是什么?

A:Goku最核心的不同在于任务覆盖范围。现有数据集基本只包含外观类编辑,比如换颜色、改风格,而Goku首次在大规模数据集中纳入了主体运动、镜头运动、参考图像引导编辑和多任务联合编辑。同时,Goku采用了三重过滤系统,淘汰约88%的生成样本,质量控制非常严格,最终保留200万对高质量样本。

Q2:Goku-Edit的双分支架构解决了什么具体问题?

A:传统单分支模型让同一个网络既负责"理解哪里要改",又负责"改成什么样子",两件事相互干扰。Goku-Edit把这两件事分开:副脑专门预测编辑区域的遮罩,主脑专注于生成修改后的视频内容。两者通过双向交叉注意力实时同步,副脑的空间约束帮助主脑把编辑限制在正确区域内,减少对不该改动区域的误伤。

Q3:SpatialCFG是什么,它在推理时怎么发挥作用?

A:SpatialCFG是一种只在推理时使用的增强策略,不需要额外训练。它的做法是同时运行两次前向计算:一次让主脑和副脑正常互联,一次断开连接各自独立运行。两次结果的差值代表了跨分支空间信号的贡献量,把这个差值放大后叠加回预测结果,就强化了空间边界约束,能有效减少编辑效果溢出到不该改动的区域的情况。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-