微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海交大联手南开大学:把好莱坞级摄影特效塞进手机,还只用了不到1GB存储空间

上海交大联手南开大学:把好莱坞级摄影特效塞进手机,还只用了不到1GB存储空间

2026-07-20 17:42
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-20 17:42 科技行者

这项由上海交通大学、南开大学与传音控股联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.03803,有兴趣深入了解的读者可以通过该编号查询完整论文。

你有没有想过,那些电影里让人叹为观止的镜头效果——比如《黑客帝国》里子弹在空中慢慢旋转、摄像机绕着人物转了360度的"子弹时间",或者希区柯克电影里背景突然拉远而人物保持不动的"眩晕变焦"——如果能在你的手机上随时生成,那会是什么感觉?

这正是研究团队希望解决的问题。他们开发了一套名为CineMobile的系统,让普通手机用户能够把一张静态照片,变成带有专业电影级摄影特效的视频。不过要做到这一点,有一道几乎无法绕过的技术高墙横在面前。

目前最强大的视频生成模型,就像一台超级豪华的专业摄影机,画质极好但体积庞大,只能放在专业摄影棚里用。具体来说,一个叫做Wan2.1-I2V-14B的主流视频生成模型,需要用NVIDIA H200这样的顶级服务器显卡,花上整整240秒,才能生成一段49帧、分辨率832×480的短视频。手机的算力与内存跟服务器相比,就像一辆自行车对上一辆重型卡车。更棘手的是,当时学界对于如何把这类先进的"扩散变换器"(Diffusion Transformer,简称DiT,一种负责视频生成计算的核心模块)部署到手机上,几乎没有成熟的方案可以借鉴。

研究团队为此设计了一套三步走的"瘦身"策略,最终把这头数十亿参数的庞然大物压缩成了一个能在手机上跑起来的轻量级模型,同时还基本保住了它的生成质量。这套系统最终实现了比原始教师模型快40倍的生成速度,整个模型占用空间不足1GB,并且能在搭载联发科天玑8400旗舰5G平台的真实手机上每步推理只需20秒,峰值内存占用仅1.8GB。

一、三步瘦身:如何把一头大象变成一只猫还保住它的本事

要理解这套方案,可以用改造一辆赛车来打比方。一辆专业赛车速度很快,但油耗惊人、体积巨大,根本开不上普通街道。工程师要做的,就是在不损失核心驾驶性能的前提下,把它改造成一辆能上路的家用车。CineMobile的三个步骤,分别对应着"剪掉冗余零件"、"训练司机用更少油门开出同样效果"和"换用更轻的材料"。

第一步叫做"结构化深度剪枝"。神经网络模型可以被理解为一条流水线,由许多个加工环节(也就是"层"或"块")串联而成。研究团队发现,这条流水线里有些环节其实是冗余的——它们做的事情跟相邻环节高度重叠,拿掉之后对最终产品质量的影响微乎其微。

为了找出这些冗余环节,研究团队给流水线上的每一个加工站安装了一个"监视探头",专门观察每个环节到底对数据做了多大的改变。如果某一段连续的加工环节改变很小,就说明这段是可以简化甚至去掉的。这里用到了一种叫做CKA相似度的数学工具,它能衡量两个环节输出的信息有多相近——越相近,说明越冗余。为了让这个判断足够准确,研究团队用了超过5000个视频样本来做校准。

找到冗余区间之后,团队并不是直接粗暴地删除那段流水线,而是用一个新的精简替代模块来填补空缺。这个替代模块从被删除区间的中间那个环节初始化,然后通过专门的训练,让它能够模仿出被删掉那一整段的效果。训练时冻结原始模型不动,只调整这个替代模块,用专门的人像和运动视频数据来保证它学会维持人物面部细节和运动轨迹的稳定性。

这里有一个非常重要的设计选择:团队只做"深度"方向的剪枝(减少层数),而不做"宽度"方向的剪枝(缩减每层的计算维度)。这个决定来自实际实验的教训——当他们尝试同时压缩宽度时,生成的人物出现了明显的面部变形和身份偏移,比如原本是一个女孩,生成出来的人物五官发生了改变。其根本原因在于,视频生成模型的内部表示维度承载着时序建模的关键信息,一旦压缩,这种信息就会被破坏,导致视频中的人物在不同帧之间出现不一致。保持宽度不变,则能让压缩后的模型继续在原始特征空间内运作,避免这类问题。

经过剪枝,原本1.5B参数的基础模型(Wan2.1-v1.1-Fun-1.5B)被压缩为一个只有1.2B参数、共27层的学生模型,推理时间从16.42秒降至12.28秒。

第二步是"步骤蒸馏",这一步带来了整个流程中最大幅度的速度提升。扩散模型生成视频的方式,类似于在纯噪声中一步步"雕刻"出清晰图像,默认需要走20步,每一步都要运行一次整个神经网络。研究团队的目标是把20步压缩到4步,让模型学会"用4步走完别人20步走的路"。

然而,直接把剪枝后的模型去做步骤压缩训练,会出现训练不稳定甚至彻底崩溃的问题,就像一个刚受过手术的运动员还没完全恢复就被推上赛场,很可能表现更差。因此,研究团队先安排了一个"康复训练"阶段,也就是有监督微调预热。

在预热阶段,学生模型先用原始密集模型生成的普通视频来恢复基本的视频生成能力,然后再用教师模型(带特效LoRA的14B大模型)生成的子弹时间、眩晕变焦、慢动作视频,让学生适应这三种特效的分布。两个阶段都使用同一个训练目标,叫做流匹配损失(Flow Matching Loss),可以理解为"生成的视频轨迹要尽量贴近目标轨迹"的约束。

预热完成之后,才进入真正的对抗蒸馏阶段。这个阶段引入了三种相互配合的信号来训练4步生成器。第一种叫做DMD损失(分布匹配蒸馏损失),思路是同时用一个"真实分数估计器"和一个"虚假分数估计器"来判断生成的视频是否足够逼真。真实分数估计器由教师模型初始化而来,代表真实视频应该有的样子;虚假分数估计器则跟着学生模型一起实时更新,追踪学生当前的生成分布。两者之间的差距,就构成了推动学生改进的压力。第二种叫做GAN损失(对抗损失),通过一个轻量级判别器来给生成视频打分,告诉学生"这段视频够不够像真实的特效视频"。第三种则是把判别器给出的评分当作强化学习奖励,用一种叫做GRPO的方法来进一步优化4步的生成轨迹——就像在围棋里让AI通过自我博弈来提升落子质量一样,模型通过奖励信号来打磨自己4步内的每一次预测。

训练时采用交替更新的节奏:每5步更新一次生成器,其余步骤更新虚假分数估计器和判别器,以保持训练稳定性。经过这一阶段,推理时间从12.28秒骤降至2.45秒,DiT运算量也降到了4.66×10??次浮点运算。

第三步是"混合精度量化"。这是一种给模型"换轻量材料"的技术。神经网络中的参数默认用16位浮点数存储,就像用高精度量尺来记录每一个数值。量化的思路是,很多参数其实不需要那么高的精度,用更粗糙的量尺记录就够了,这样每个参数占用的存储空间更小,运算起来也更快。

研究团队采用了混合精度策略,而非一刀切地对所有参数降精度。对于注意力机制、文本嵌入、时间嵌入等相对敏感的层,使用FP8精度(8位浮点数)存储权重;对于每个模块中占参数量大头的前馈网络(FFN),则使用更激进的INT4精度(4位整数)存储权重;所有层的激活值(也就是运算过程中的中间结果)始终保持16位精度,以维持数值稳定性。经过这套组合拳,模型的存储占用被压缩到1GB以下,推理时间进一步小幅优化至2.42秒。

二、手机上的好莱坞:三种特效是如何实现的

CineMobile支持的三种特效,每一种都有鲜明的视觉特征和独特的技术要求。

子弹时间是一种让时间仿佛凝固、摄像机却能自由飞翔的效果。在真实电影拍摄中,需要数十台摄像机围绕主体排成一圈同时拍摄,才能在后期合成这种效果。在CineMobile中,模型需要在保持人物外貌和场景结构完全一致的前提下,生成一段流畅的、摄像机围绕主体旋转的视频。这对模型的时序一致性和摄像机轨迹控制能力要求极高。

眩晕变焦,也叫希区柯克变焦或"Dolly Zoom",是电影史上非常经典的一种镜头语言,最早由希区柯克在电影《迷魂记》中使用。它的原理是:摄像机向后移动的同时,镜头焦距同步拉长,让前景人物在画面中保持相同大小,但背景却发生戏剧性的透视压缩或拉伸。这种效果在视觉上会产生强烈的空间扭曲感和心理压迫感。模型需要同时处理前景锁定和背景变形这两个相互矛盾的约束,难度相当高。

慢动作效果则更注重时间维度上的拉伸感。与子弹时间和眩晕变焦不同,慢动作效果不依赖显式的摄像机运动控制,而是更强调帧与帧之间运动的平滑过渡、物体外观细节的保留以及减少运动伪影。研究团队用了一种有趣的数据构建方式:先让模型生成富含动作的普通速度视频,然后通过帧插值技术(用FILM算法将帧数扩展为原来的2倍)来得到慢动作版本,再用这些数据来训练专门的慢动作LoRA适配器。

为了支持这三种不同特效,CineMobile采用了"一个共享骨干网络加上特效专属LoRA模块"的设计。LoRA是一种轻量级的参数微调技术,可以理解为给同一台相机配了三个不同的镜头滤镜,不同滤镜对应不同特效,但相机本身(骨干网络)是共用的。这样既节省了存储空间,又保证了不同特效之间的切换灵活性。

三、性能检验:40倍加速之后还剩多少画质

一项关键的问题是:经过如此激进的压缩,生成的视频质量还能保住多少?研究团队用了两种方式来回答这个问题。

第一种是自动化评估,采用业界通用的VBench评测框架。这套框架从多个维度评估视频质量,包括主体一致性(视频中人物的外貌是否始终保持一致)、背景一致性(背景场景是否稳定)、运动流畅度、美学质量、成像质量,以及图像到视频任务特有的主体保留度和背景保留度,最终加权计算总分。

在子弹时间场景下,作为参照的14B教师模型得到89.27分,而CineMobile(4步、1.2B参数)得到了88.35分,差距只有0.92分。在眩晕变焦场景下,教师模型89.96分,CineMobile得到89.30分,差距0.66分。在慢动作场景下,教师模型88.51分,CineMobile得到88.05分,差距0.46分。换句话说,用了不到10%的参数量、20%的推理步数,CineMobile把画质损失控制在了1分以内。

进一步观察各项子指标,CineMobile在运动流畅度和图像到视频的一致性方面表现尤为稳定,说明4步学生模型在维持视频时序连贯性和图像条件对齐上没有出现明显退化。

值得一提的是,研究团队还把CineMobile与几款公认的高质量开源视频生成模型放在同一测试集上做了横向比较。HunyuanVideo-1.5(8.3B参数,12步)得到89.83分,LTX2.3(22B参数,12步)得到89.42分,Open-Sora2.0(11B参数,50步)得到88.54分。CineMobile在各特效场景下的得分与Open-Sora2.0相当,而模型参数量只有后者的约11%。

第二种是人工评估,专门针对子弹时间效果,邀请10位参与者对50段匿名视频进行评分,被评模型包括CineMobile以及Kling 2.5 Turbo、Hailuo 2.3、Vidu Q3、Wan2.7这几款商业或知名系统。评分维度包括伪影控制(是否有闪烁、鬼影等瑕疵)、形变程度(场景几何是否自然)、画面均匀性(风格、光照、色调是否稳定)、时序一致性(人物和运动是否连贯)以及摄像机控制(是否准确实现了预期的子弹时间轨迹)。

结果显示,CineMobile在摄像机控制维度上取得了所有参选模型中的最高分,而在其他维度上与商业模型基本持平。这个结果与CineMobile的设计初衷高度吻合——它的核心目标就是在移动端实现高度可控的电影特效,而非在所有图像质量维度上超越所有人。

研究团队还做了一个额外的对比实验,专门测试慢动作效果。他们把CineMobile与一种传统的帧插值方法FILM进行了对比,任务设定是:只给出第一帧和最后一帧,生成中间20倍慢动作的完整视频。FILM在这个测试中得到了30.57 dB的PSNR值和0.713的SSIM值,而CineMobile分别达到了35.68 dB和0.858。两项指标都有显著提升,说明对于跨越大时间跨度的慢动作合成,直接用生成模型来"想象"中间过程,比传统插值方法更能避免物体穿透和运动失真的问题。

四、GRPO的贡献:用奖励信号擦亮最后一公里

在消融实验中,研究团队专门检验了GRPO这个强化学习模块到底贡献了多少。对比实验在完全相同的4步生成设置下进行,分别测试基础模型(未加GRPO)和CineMobile(加了GRPO)在子弹时间任务上的表现。

不加GRPO时,基础模型得到88.25分;加上GRPO后提升至88.77分,增幅0.52分。对应的,CineMobile不加GRPO时得到87.88分,加上GRPO后提升至88.35分,增幅0.47分。仔细看各子项,增益主要集中在美学质量和成像质量两项,而主体一致性、背景一致性、运动流畅度等维度基本没有变化。这个模式说明GRPO不是在改变模型的运动建模方式,而是在打磨视频的感官体验——让画面更好看、更清晰,而不破坏已经建立好的时序一致性。

五、手机上的实际表现:内存与延迟

研究团队在一台搭载联发科天玑8400旗舰5G平台的真实手机(Infinix NOTE 60 Ultra)上做了实际部署测试。天玑8400集成了全大核ARM Cortex-A725处理器、ARM Mali-G720 MP7 GPU(理论FP32算力约2.33 TFLOPS,与NVIDIA GeForce GTX 960相当)以及联发科NPU 880神经网络处理器。

实测结果是:手机处于正常待机状态时,系统内存占用约3994 MB。加载CineMobile之后,内存增加了1127 MB,达到5121 MB。在480p分辨率的推理峰值时,内存进一步增加736 MB,达到5857 MB。也就是说,CineMobile在整个运行周期内相比空闲手机只额外占用了约1863 MB的内存,完全在主流旗舰手机的内存容量范围内正常运行。每步推理延迟为20.02秒,4步共计约80秒完成一段49帧480p视频的生成。

这里补充一个对比背景:原始14B教师模型在NVIDIA H200服务器显卡上跑40步需要97.06秒,也就是说即便是在手机上4步生成,CineMobile的总时间(约80秒)与服务器模型的总时间在同一数量级,而算力差距却是天壤之别。当然,服务器模型生成的视频质量更高,这里只是说明CineMobile在手机这个极度受限的计算环境中,已经达到了"可用"的程度。

六、研究细节:训练数据与实验设置

整个训练流程分阶段进行,都在8块NVIDIA H200 GPU上完成。剪枝阶段用超过5000个样本做冗余区间检测,再用8000步的训练来恢复压缩后模型的基本能力。有监督微调预热阶段沿用DiffSynth-Studio框架,训练5000步,学习率设为0.0001,LoRA秩(rank)设为128。蒸馏阶段用超过10000个训练样本,学习率同样是0.0001,对抗损失权重设为0.5,分布匹配蒸馏损失权重设为0.005,判别器和虚假分数估计器的学习率设为0.00001。

训练数据方面,子弹时间和眩晕变焦使用了PPR10K高质量人像数据集作为图像来源;慢动作使用了从Pexels和Pixabay收集的运动导向图像。每种特效的训练集包含超过10000个样本。

数据预处理方面,研究团队用Qwen3-VL-30B-A3B-Instruct这个大型视觉语言模型来自动筛选数据,过滤掉背景过于简单或无信息量的图像、曝光严重过度或不足的图像、分辨率不达标的图像、包含多个显著人物的图像、过于近距离的面部特写、没有人类主体的图像,以及构图不合理、前背景关系模糊、运动潜力有限的图像。经过这一道自动筛选,训练数据的质量和任务适配性得到了显著提升。

教师模型方面,子弹时间和眩晕变焦使用了公开可用的特效LoRA适配器;慢动作的LoRA适配器则是由研究团队自行训练的,方法是先让基础模型生成富含动作的视频,再用FILM帧插值技术将每段视频扩展为2倍帧率的慢动作版本,最后用这些数据微调出专属的慢动作LoRA。

说到底,CineMobile做的事情是把原本只有专业服务器才能完成的视频生成任务,装进了一部消费级手机。它不是在追求无条件的质量最大化,而是在"够用的质量"和"手机能跑得动"之间找到了一个合理的平衡点。从数字上看,这个平衡点在VBench总分上约有0.5到1分的损失,却换来了超过40倍的速度提升和超过10倍的参数压缩比。

当然,这项研究也有其边界。CineMobile目前专注于三种结构明确、运动模式相对固定的特效,并没有尝试支持更开放、更复杂的文本描述生成,研究团队也在论文中坦承,在激进加速下完全保留自由文本语义的能力目前仍然是一个难点。此外,手机上每步20秒、4步共约80秒的生成时间,对于很多即时性要求高的应用场景来说还是偏长,未来的工作空间依然很大。

不过,这项研究最大的价值或许不仅仅在于CineMobile本身,而在于它打通了"DiT类视频生成模型的移动端部署"这条路线——包括结构化深度剪枝的设计选择、分阶段蒸馏的稳定训练策略,以及混合精度量化的具体配方,都为后续研究提供了可以借鉴和扩展的基础。

如果你对这项研究感兴趣,可以通过arXiv编号2607.03803查阅完整论文,更细致的技术细节、完整的消融实验数据以及更多视频样例都在其中。

---

Q&A

Q1:CineMobile支持的子弹时间、眩晕变焦、慢动作这三种特效在技术上有什么区别?

A:子弹时间要求摄像机绕主体做轨迹运动同时保持主体外貌不变;眩晕变焦需要同时处理前景锁定和背景透视变形两个矛盾约束;慢动作则不依赖摄像机控制,而是聚焦于帧间运动平滑和物体细节保留。三者对模型能力的考验方向各不相同,也因此需要分别训练特效专属的LoRA适配器。

Q2:CineMobile用了哪些方法来压缩模型?

A:CineMobile采用了三步组合策略。第一步是结构化深度剪枝,用CKA相似度找出神经网络中冗余的层块并用轻量替代模块填补;第二步是步骤蒸馏,通过有监督预热加对抗蒸馏加GRPO强化学习,把20步推理压缩成4步;第三步是混合精度量化,对FFN层用4位整数、其他层用8位浮点数,把模型存储压到1GB以下。

Q3:CineMobile在普通手机上运行需要多少内存和时间?

A:在搭载联发科天玑8400平台的手机上,CineMobile加载时增加约1127 MB内存,推理峰值时额外再增加约736 MB,相比手机空闲状态共额外占用约1863 MB。生成一段49帧480p视频每步需要约20秒,4步共约80秒完成。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-