这项由台湾阳明交通大学多位研究人员联合完成的研究,发表于2026年7月的SIGGRAPH Conference Papers(会议时间为2026年7月19日至23日,在美国洛杉矶举行),论文编号为DOI 10.1145/3799902.3811151,arXiv编号2607.08770。感兴趣的读者可通过上述编号查阅完整原文。
手机拍视频时,如果拍摄对象动得太快——比如飞速旋转的风扇叶片、高速行驶的赛车——画面往往会变得模糊一片,这是因为普通相机有个天然的短板:它每隔固定时间才"咔哒"一声拍一帧,动得太快的东西就会留下残影。科学家们因此发明了一种"事件相机",它不按固定节拍拍照,而是像人眼神经一样,只要某个像素点的亮度发生了变化,就立刻记录下来,精度可以达到百万分之一秒。这种相机在高速运动、强光弱光交替的场景下表现出色,是无人机导航、高速机器人视觉等领域的理想传感器。
然而,事件相机有一个令人头疼的问题:它输出的不是普通照片或视频,而是一串稀疏的"亮度变化信号",和人类习惯看到的画面格格不入,现有的大多数计算机视觉算法根本看不懂这些数据。如何把这些零散的信号还原成人眼可以欣赏的高质量视频,一直是这个领域的核心挑战。更难的是,不同任务对这些信号的处理方式也不一样——有时候我们只有事件信号,想从头重建画面;有时候我们有起始帧,想预测接下来会发生什么;还有时候我们有开头和结尾两帧,想补出中间过渡的画面。过去这三件事往往需要三套不同的系统来分别处理,既麻烦又低效。
台湾阳明交通大学的这支研究团队提出了一个名为LongE2V的方法,核心思路是借助已经在海量视频数据上训练好的"视频扩散模型"——一种能够凭借丰富的视觉经验生成和补全视频的AI系统——来同时解决上面三个问题,并专门设计了一系列配套机制,让生成的视频在极长序列下也能保持稳定、不漂移、不出现鬼影。
一、从模糊到清晰:现有方法为什么总差那么一口气
要理解这项研究解决了什么,先得知道之前的方法卡在哪里。
过去最主流的做法是用"回归模型"来处理事件相机数据。所谓回归,可以这样理解:假设你要猜一个人的身高,你把所有可能的身高都投票给一个最稳妥的中间值,结果虽然不会太离谱,但也很难非常准确。把这个逻辑用到视频重建上,模型会倾向于生成一个"取悦大多数可能情况"的画面,也就是说,它会把细节磨平,生成一张看起来差不多但其实哪里都不够清晰的模糊图像。就像让一个画师凭记忆临摹一幅他没见过几次的画,他画出来的往往是一个模糊的轮廓,而不是精确的细节。这种现象在学术上叫"回归均值",是导致E2VID等经典方法画面模糊的根本原因。
近年来,扩散模型在图像和视频生成领域大放异彩,它的原理更像是一位有丰富绘画经验的艺术家:在大量真实图像的熏陶下,它学会了"什么样的画面是真实、合理、细节丰富的",所以在补全或重建图像时,它会主动填充合理的细节,而不是简单取个平均值。把扩散模型用于事件相机视频重建,理论上可以突破模糊的瓶颈。
但问题随之而来。当需要处理的不是短短几帧,而是成百上千帧的长序列时,扩散模型会出现严重的"时间漂移"现象。可以用一个比喻来理解:假设你在玩一个接龙游戏,每次都用上一个人说的最后一个词接下去,起初还好,但随着接龙越来越长,每个人的小偏差都会被累积放大,最终说出来的话和开头已经完全风马牛不相及。扩散模型在长视频生成中也是如此——它用自己生成的上一段作为下一段的参考,每一段的小误差都会在下一段被继承甚至放大,久而久之颜色偏了、结构乱了、人物飘移了,这就是所谓的"错误累积与时间漂移"。
另外,在视频帧插值(补中间帧)这个任务上,已有方法在大幅度运动场景下容易出现"鬼影"——同一个运动物体在画面里出现了两个半透明的轮廓,像是照片曝光过度时的重影,严重影响视觉效果。
LongE2V正是为了同时解决这三个问题而诞生的。
二、借力打力:用现成的"视频大脑"处理事件相机信号
这支研究团队的核心策略,是不从零开始训练一个全新的AI,而是站在巨人的肩膀上。他们选择了CogVideoX这个已经在大规模视频数据上训练好的视频扩散模型,作为自己系统的"大脑底座"。
这个底座的价值在于:它已经从海量真实视频中学到了"现实世界的视觉规律"——物体在运动时应该是什么样子、光影是怎么变化的、细节应该如何分布。有了这个基础,研究团队只需要再用相对少量的事件相机数据进行"微调",就能让这个大脑理解事件信号的语言,而不需要从头喂给它数以亿计的训练样本。这就像一个已经会说英语和法语的人学西班牙语,比一个从零开始学外语的人要快得多、学得也好得多。
在技术实现上,事件相机产生的信号首先被整理成一种叫"事件体素"的格式——把一段时间内的亮度变化信号按时间分成若干层,叠成一个三维数据块。研究团队把这个数据块设置成三层,恰好可以像普通RGB三通道图像一样被标准的图像编码器处理,这个小巧思省去了专门设计新编码器的麻烦。
在模型的输入端,系统同时接收三类信息:当前时间窗口的事件体素、一帧"起始参考帧"(告诉模型现在世界长什么样),以及前一段视频作为"历史上下文"(告诉模型刚才发生了什么)。这三类信息经过各自的编码处理后,在特征空间中拼接在一起,送入扩散模型进行视频生成。为了让扩散模型能处理多出来的事件通道,团队对模型的第一个投影层进行了扩展,并用LoRA(一种高效的低秩微调技术,相当于只调整模型中少数几个"旋钮"而不是全部重新拧一遍)来微调主干网络,大大降低了训练成本。
三个不同任务共用同一套权重,通过改变输入条件来切换:纯事件信号输入就是视频重建,加上起始帧就是视频预测,同时给出起始帧和结束帧就是帧插值。这种"一套系统、三种用途"的设计是LongE2V在灵活性上的重要优势。
三、防止"跑偏":让长视频保持稳定的两把钥匙
解决了单段视频的质量问题之后,更大的挑战出现了:如何让几百帧乃至几千帧的长视频保持始终如一的稳定?
研究团队为此设计了两套机制,可以把它们理解为"纠偏系统"的两个组成部分。
第一套机制叫"自回归展开训练"。这个名字听起来复杂,背后的道理却很朴素。在训练阶段,模型最初是喂给它"完美的、真实的"前一段视频作为历史上下文,这当然没问题。但在实际使用时,哪里来的"完美的前一段"?前一段本身就是模型自己生成的,多少会有些误差。如果模型只见过完美的历史,突然要面对自己生成的不完美历史,就会手足无措,错误会迅速放大。
于是,训练团队在模型基本学会基础技能之后,引入了一个"自我对抗"的训练阶段:先用模型对训练集生成一遍预测结果,然后把这些有误差的生成结果当作历史上下文,继续训练模型。这个过程重复进行三轮,每一轮模型都在适应自己可能犯的错误,慢慢地学会在"不完美的历史"下依然生成稳定的结果。这就像一个厨师,起初只用最好的食材练手,后来刻意用卖相普通的食材反复练习,最终无论食材好坏都能做出美味的菜肴。
第二套机制叫"自适应上下文切换"。即便有了自回归训练的加持,错误依然可能在极长序列中缓慢累积。这套机制的作用是动态判断:当前生成的这一段,是否真的还在借鉴历史上下文?如果历史上下文已经和当前内容"脱节"了(模型注意力几乎不再看历史了),那就主动触发一次"上下文更新"——用刚生成的这段替换掉过时的历史,重新校准。
具体判断方法是:在扩散模型内部,每个注意力层都有一个"注意力权重矩阵",记录着当前帧在生成时有多依赖历史上下文帧。研究团队计算出所有层、所有注意力头上,当前帧对历史帧的平均注意力权重。当这个数值低于0.05时,说明历史上下文已经失去了参考价值,系统就丢弃当前生成结果,更新历史上下文,然后重新生成。这就像一个导航系统,不是每隔固定时间就重新规划路线,而是在发现"当前地图和实际道路不符了"的时候才触发重新规划,既避免了过度更新带来的不连贯,也防止了长时间不更新导致的偏航。
四、补帧的精妙:解决"正放和倒放"之间的时间错位
帧插值任务有一个独特之处——给了开头帧和结尾帧,要补出中间的过渡。一种自然的思路是:从开头往后生成一遍(正向分支),再从结尾往前生成一遍(反向分支),然后把两遍的结果融合起来,取长补短。
但这里藏着一个不易察觉的技术陷阱。
扩散模型内部会把视频帧编码成一种压缩的"潜在表示"(可以理解为视频的"浓缩精华"版本),而这个编码过程是有时间结构的——它按顺序压缩帧,前后帧之间存在依赖关系,就像用特定方式折叠好的纸,顺序不能乱。如果想把反向分支的结果拿来和正向分支对齐,直接在"浓缩精华"层面做时间翻转,得到的结果和先把视频翻转再重新压缩的结果是不一样的。换句话说,在压缩空间里翻转,和在原始画面空间里翻转,不是同一件事——这个不等式是导致两个分支产生错位的根本原因。
为了解决这个问题,研究团队提出了"重编码对齐"方案:不要在压缩空间里直接翻转,而是先把压缩后的结果解码回真实画面,在真实画面层面做时间翻转,然后再重新压缩。虽然多了解码和重压缩两步,但这样得到的翻转结果和直接翻转视频再压缩是等价的,两个分支之间的时间对齐就此保证。
不过,解码和重新压缩的过程本身会造成一定的信息损失——就像把一张照片从JPEG解压再重新压缩,每次都会损失一点细节。为了弥补这个损失,研究团队又提出了"交叉残差修正"方案:分别计算正向和反向分支在压缩前后的"差值"(即损失掉的细节信息),然后把正向分支的差值"注入"到反向分支对齐后的结果里,同时把反向分支的差值注入到正向分支里。这样,两个分支互相帮对方补回在重压缩时丢失的细节,还顺带增强了两个分支在时间上的一致性——因为互相交换了细节信息,两个分支对同一时刻的理解会更加接近。最终,两个经过修正的分支通过加权混合(靠近起始帧时更信任正向分支,靠近结束帧时更信任反向分支)融合成最终的插值结果。
五、让模型适应不同相机:事件体素密度增强
事件相机有各种不同的分辨率和型号,不同相机在同样的运动场景下产生的事件数据密度可能差异很大。如果模型只见过某种固定密度的事件数据,换一台相机就可能表现大幅下滑。
为了增强泛化能力,研究团队设计了一种"密度增强"策略:在训练时,随机对事件体素进行缩放(缩放比例在合理范围内随机选取),然后随机裁剪出目标尺寸。这样,模型在训练过程中见过各种不同密度的事件数据,对密度的变化就不那么敏感了。同时,为了保证事件数据和视频帧之间的空间对齐,对事件体素的缩放和裁剪操作会同步施加到对应的视频帧上,确保两者始终一一对应。此外,在归一化处理时,参照了FireNet的方法,只基于非零值的统计量进行归一化,以保留事件数据天然的稀疏性特征。
六、实验结果:在三个任务上全面超越前辈
研究团队在多个真实世界数据集上对LongE2V进行了全面评测。训练数据仅使用了BS-ERGB数据集的训练集,共7636帧,规模相当小;但测试则覆盖了ECD、MVSEC、HQF三个完全不同的数据集,序列长度从约300帧到2740帧不等,充分考验了模型的泛化能力和长期稳定性。
在视频重建任务上,LongE2V在全部三个数据集上均取得了最佳的LPIPS指标(这个指标衡量的是人类对图像质量的感知,分数越低越好)。与回归类方法相比,LongE2V重建出的画面细节更丰富、纹理更清晰,不再是那种"哪里都差不多但哪里都不清楚"的模糊感。在PSNR(峰值信噪比)和SSIM(结构相似性)指标上,LongE2V也与最强的回归类基线(HyperE2VID)持平甚至超越。
在视频预测任务上,与唯一的扩散模型类对手VDM-EVFI相比,LongE2V的优势非常显著。以ECD数据集为例,PSNR从20.33提升到24.40,SSIM从0.614提升到0.771,LPIPS从0.244降低到0.110,三项指标全线大幅领先。更直观的是,在处理HQF这类长达2430帧的超长序列时,VDM-EVFI的画面会出现明显的颜色漂移和结构崩塌,而LongE2V始终保持稳定的视觉质量。
在帧插值任务上,LongE2V没有进行任何专门的微调,直接用重建和预测任务训练好的权重,在零样本的条件下与专门为帧插值设计并经过有监督训练的CBMNet-Large和TLXNet+进行比较。结果是:在BS-ERGB测试集上,LongE2V的LPIPS(0.124)显著优于CBMNet-Large(0.170)和TLXNet+(0.226);在HQF数据集上,LongE2V的全部三项指标均为最佳(PSNR 25.39,SSIM 0.800,LPIPS 0.105)。在处理大幅运动的真实场景时,CBMNet-Large出现了严重的鬼影和颜色错误,TLXNet+则结构崩塌,而LongE2V在零样本条件下依然给出了清晰、连贯的插值结果,甚至连画面中的文字细节都能清晰辨认。
七、额外能力与局限性
在训练时以20%的概率引入文本提示之后,LongE2V获得了一项额外能力:文本引导的事件视频着色。事件相机本身只记录亮度变化,生成的重建视频是灰度的;但当用户提供一段文字描述(比如"这个场景中央是一个五彩缤纷的积木结构……"),模型能够在保持事件数据决定的结构和运动的前提下,按照文字的描述给画面上色,实现灰度事件视频到彩色视频的自动转换。通过XT切片(即把视频某一行像素在时间轴上的变化展开成一张图)可以验证,上色后的视频在时间上是连贯的,不会出现颜色一帧一帧地乱跳。
在速度方面,LongE2V每秒处理约0.28帧(即生成一帧需要约3.6秒),明显慢于E2VID等非扩散类方法(每帧约0.0024秒),但比同类扩散模型VDM-EVFI(每帧约5.4秒)快了约1.5倍。这种速度差距在当前阶段对实时应用还有限制,但研究团队也指出加速推理是下一步的重要方向。
在局限性方面,当事件流非常稀疏或质量很差时,模型也会力不从心,重建出来的画面质量明显下滑。另外,事件相机本身存在一种叫"热像素"的噪声——某些像素点因为硬件缺陷会不断触发错误事件,LongE2V对这种噪声比较敏感,有时会把噪声当成真实信号保留甚至放大到重建画面中。这两点是当前版本尚未完全解决的问题。
说到底,这项研究最有意思的地方在于:它没有试图从零发明一套全新的AI,而是聪明地把一个已经"见多识广"的视频生成模型,改造成了能听懂事件相机语言的视觉专家。通过三套精心设计的配套机制——自回归展开训练、自适应上下文切换、重编码对齐加交叉残差修正——把扩散模型在长视频和精确插值上的短板补了起来。更难得的是,整套系统训练数据量极小(不到八千帧),却能泛化到多个完全不同的测试集,在三个任务上都打败了专门针对各自任务设计的对手。
对于普通人来说,这项技术的潜在影响可能体现在这样一些场景:无人机在夜间或强光环境下拍摄的事件相机数据,可以被还原成人类可读的高清视频;高速运动的体育画面可以被精确补帧,不再有鬼影;安防摄像头在极端光线条件下采集的事件数据,可以被转化为结构清晰的监控画面。当然,距离这些应用真正落地,还需要解决推理速度慢的问题,以及对噪声鲁棒性不足的问题。
下一步,研究团队计划探索加速推理的方法,以及更高效的长期记忆机制,让系统在处理更长的视频序列时依然能够保持稳定。
---
Q&A
Q1:事件相机和普通相机有什么根本区别?
A:普通相机按固定节拍拍照,每隔固定时间输出一整帧图像;事件相机则不拍整帧,而是在每个像素点亮度发生变化时立刻记录这个变化事件,精度可达百万分之一秒。事件相机在高速运动和强光弱光交替场景下不会产生运动模糊,但输出的是稀疏的变化信号,而不是人眼可直接看懂的图像,需要后续算法重建成视频。
Q2:LongE2V为什么可以用同一套权重做视频重建、视频预测和帧插值三件事?
A:LongE2V把这三个任务都统一成"基于事件信号的条件视频生成",通过改变输入条件来区分任务:只有事件信号就做重建,加上起始帧就做预测,同时给起始帧和结束帧就做帧插值。由于底层都是同一个扩散模型在处理事件条件,权重可以共享,无需为每个任务单独训练一套系统。
Q3:LongE2V的帧插值为什么是零样本,效果却比专门训练的方法还好?
A:LongE2V在训练时只针对重建和预测任务,从未用帧插值数据专门训练。它能做帧插值,依靠的是"重编码对齐"和"交叉残差修正"两套推理时的技巧,以及底层扩散模型本身从大量视频数据中学到的丰富视觉先验。对比方法虽然专门训练了帧插值,但在大幅运动和真实噪声下容易产生鬼影和结构崩塌,而LongE2V的生成式方法在这些困难场景下反而更稳健。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。