
这项由清华大学与生数科技联合完成的研究,于2026年7月3日以预印本形式发布在arXiv平台,编号为arXiv:2607.03118v1。有兴趣深入了解的读者可以通过该编号查询完整论文。
你有没有想过,有一天手机屏幕里的虚拟主播能听懂你说的话,然后立刻做出你要求的动作——你说"举起右手",它就举起右手;你说"坐下",它就坐下;而且这一切都发生在你话音刚落的瞬间,没有等待,没有卡顿,画面始终流畅清晰?这不是科幻电影的场景,清华大学和生数科技的研究团队已经将这个设想变成了现实,他们把这个系统叫做Vidu S1。
**现有技术的困境:等一分钟,换来一段视频**
在理解Vidu S1之前,先来感受一下现有的视频生成技术究竟有多"慢"。今天主流的AI视频生成模型,比如Sora、Veo、Wan和Seedance,工作方式都像一家老派的照相馆冲洗胶卷——你把要求交给它,然后走开等着,十分钟后、二十分钟后,它把成品递给你,这期间你什么都改变不了,也参与不进去。这叫"离线生成",本质上是AI把整段视频从头到尾全算完了,才交到你手里。
这种方式在制作事先规划好的内容时没问题,但人类对视觉互动的需求远不止于此。面对面聊天、直播连麦、打游戏、和虚拟助手实时对话——这些场景的核心是"立刻回应",不是"等会儿给你"。研究团队做了一个有趣的估算:假设每个用户对实时互动视频内容的需求和对预制视频内容的需求各占一半,由于预制视频可以被成百上千人反复观看,实际上每段视频只需要生成一次;而实时互动视频每次交互都要重新生成,需求量是预制视频的数百倍。换句话说,实时互动视频生成是一个远比预制视频大得多的市场,也是研究团队认为最重要的未来方向之一。
现有的尝试已经有人在做,但都有明显短板。有些系统把视频生成从"一次全算完"改成了"一帧一帧地算",但用户仍然不能在过程中插手干预。更多系统不支持用语音直接发号施令,用户只能在生成前把指令全写好,生成开始后只能眼睁睁看着。最棘手的问题是"漂移":当AI一帧一帧地自动续写视频时,每一帧的微小错误会像滚雪球一样累积,最终画面就像一张被不断复印的纸,越来越模糊,越来越走样,最后彻底崩掉。正因为这个原因,大多数系统只能生成几十秒或几分钟的视频,没法持续生成。
**Vidu S1的四张王牌**
Vidu S1是清华大学和生数科技团队针对上述所有问题给出的整体解决方案,可以用四句话来概括它的核心能力。
其一,用户可以在视频生成的任意时刻发出语音指令,系统会实时响应并改变接下来的生成内容,而不是只能在开始前预设好所有条件。其二,用户的声音被当作直接的、明确的控制信号,说什么动作,虚拟人物就做什么动作,语音和行为之间有清晰的因果关系。其三,视频可以无限长度地持续生成,不会因为时间积累而出现画面漂移、崩坏或视觉失真。其四,整个系统在普通消费级显卡上就能运行,输出540p分辨率、每秒42帧的实时视频,流畅度远超普通播放所需的每秒30帧门槛。
**一、让AI学会"表演"的数据工厂**
要训练一个能实时听指令动起来的虚拟人,首先得给AI看大量高质量的"表演样本",让它学会人是怎么说话、怎么动、表情和嘴型怎么配合声音的。但原始视频素材就像一批混杂了残次品的货物,直接用来训练会让AI学到一堆错误的东西。研究团队因此搭建了一条六道工序的流水线,把原始视频一步步精炼成可用的训练素材。
这条流水线的起点是"预筛选"。团队收集了两类原始视频:一类是直播视频和说话人正对镜头的视频,用来让AI学习面部表情、身体动作和嘴型同步这些细节;另一类是影视剧中的高质量镜头,用来让AI学习在不同角度、不同场景、不同画风下保持稳定。进入流水线之前,所有素材先按帧率、分辨率、音视频完整性和音画同步等硬指标做一轮粗筛,把明显不合格的直接淘汰。
通过粗筛后,视频被切割成一个个连续的单镜头片段,切割点不会落在说话中途,保证每段素材都是完整的一句话配完整的一个动作。每段素材的时长在三秒到六十秒之间。
接下来是六个维度的精细过滤。首先检查画面里是否只有一个主角,且主角占据了合理的画面比例,避免AI学到群体场景而搞混。其次检查画面干净程度,字幕、水印、广告浮层这些与视觉内容无关的东西统统过滤掉。第三关检查视觉质量,通过审美评分和技术评分挑出清晰、完整、好看的片段,模糊、抖动、闪烁的镜头一概排除。第四关是内容安全审核,把不适当内容拦在训练数据之外。第五关检查镜头稳定性,优先保留静止镜头或慢速运动的镜头,降低AI在生成长视频时发生镜头漂移的风险。第六关检查"互动性",要求画面中的主角有清晰可见的动作或行为,让AI真正学到有意义的运动信息,而不是对着一个纹丝不动的人发呆。
在这六道过滤之外,团队还面临一个特别的技术挑战:传统的人脸检测模型遇到夸张的卡通形象或高度风格化的2D动画角色时,常常认不出来,判断会出错;而且很多判断模型是基于单帧图片的,看不到视频的整体信息,容易产生错误评估。为此,团队引入了一个能理解完整视频语义的"全能模型"来做补充,这个模型会从编辑、主体、动作、情绪、面部、语音、场景、镜头、色调等多个维度生成语义标签,和传统专家模型联手构成一个既有全局视野又有局部敏感度的联合过滤系统。
过滤完成后,还需要处理声音。AI要学会嘴型和声音同步,就必须知道每一帧的声音来自谁。研究团队对音频做了说话人分离标注,把每段音频中每个说话的时间段标上是谁在说。每段音频被分成三类:说话的人和画面里的人是同一个人(在画面中),说话的人不在画面里(在画面外),以及同时有多个声音重叠(重叠段)。含有重叠段的片段直接丢弃,因为AI无法从中学到清晰的嘴型对应关系。此外,团队还注意到,在有歌唱或强烈背景音乐的场景中,说话人分离模型会把歌声错误地归类成说话声,引入噪音,于是专门加了一条规则:当说话能量占总音频能量的比例过低时,该片段也被丢弃。
最后一步是为每段视频生成文字描述(字幕)。描述分两个层次:一是覆盖整段视频的全局描述,提供完整的语义背景;二是与时间段对齐的细粒度描述,精确到每个时间窗口里发生了什么。描述的内容涵盖人物外貌、动作、运动、情绪、场景、摄影语言、光线风格、画面内文字、对话内容、音效和背景音乐等方方面面。为了减少视觉和听觉信息之间的相互干扰,团队采用了"双路策略":视觉属性只从视频帧中推断,听觉属性只从音频轨道中推断,两路信息各自独立,最后合并。
**二、三段式训练:从全知到实时,从慢速到极速**
有了精心准备的训练数据,接下来是让AI真正学会生成视频。研究团队设计了三个递进的训练阶段,就像培养一名演员:先让他在排练室里看完整的剧本彩排,再让他学会即兴续演,最后再逼他把演出速度提到极致。
**第一阶段:全知视角下的打基础**
第一阶段训练的是一个"双向模型"。所谓双向,是指这个模型在学习时可以看到一段视频的所有帧,从第一帧到最后一帧全部可见,就像一个人坐在剪辑台前,把整部电影从头到尾反复看,然后学习整体的影像规律。这种全局视角让模型能建立起高质量的生成基础,知道一段"好视频"应该长什么样,声音和画面之间应该有什么样的配合关系。这一阶段产出的模型是后续两个阶段的起点。
**第二阶段:学会"接着演",适应实时场景**
第二阶段把第一阶段训练好的模型改造成"因果模型"。在真实的实时生成场景里,AI不能"看到未来",它只能根据已经发生的历史画面和当前收到的指令,去预测下一帧应该是什么。这就像一个演员在台上即兴表演,他只记得之前发生的情节,不知道剧本接下来写了什么,必须自己想象并自然地续下去。
为了让模型在训练时的表现和实际使用时的表现尽量一致,研究团队采用了一种混合训练策略,结合了两种不同的学习方式。一种叫"教师强制",就是给模型看真实的历史帧作为上下文,相当于告诉演员"之前真实发生的故事是这样的,你接着演",这有助于模型学习准确的动作和表情衔接。另一种叫"扩散强制",给模型看的历史帧不是完美的,而是加了一些噪声的模糊版本,相当于告诉演员"你对之前发生的事记忆有点模糊,凑合着接着演",这迫使模型学会在面对不完美的历史信息时依然能稳定地续写,而不是一遇到偏差就崩掉。
**第三阶段:从慢速到极速,用蒸馏提升推理效率**
经过前两个阶段,模型已经能稳定地一帧一帧续写视频,但还不够快。传统的扩散模型每生成一帧都需要做几十次甚至上百次的去噪计算,延迟太高,根本无法支持实时应用。第三阶段的目标就是把这个复杂的多步过程压缩到只需要几步。
压缩的方法叫"分布匹配蒸馏",大意是让一个"学生模型"学着用更少的步骤产出和"教师模型"几乎一样质量的结果。可以用烹饪来理解这个过程:原来做一道菜需要十道工序,每道工序都不能省;蒸馏之后,学生模型只用三道关键工序就能做出和原来差不多味道的菜,大幅节省时间。
但仅仅靠分布匹配蒸馏还不够。研究团队发现,这种训练方法容易让模型"走极端",出现画面漂移、内容退化、时间上不连贯等问题,就像菜谱简化后可能让厨师只会做一道菜而不是一系列菜。为了防止这种现象,团队引入了"相位一致性模型"作为额外的约束,让学生模型在追求速度的同时,还要保证生成结果在感知上和教师模型的结果相近,用一种基于图像感知特征的距离函数来衡量差异,从而兼顾效率和质量。
**三、无限续写而不崩坏:滑窗推理与双缓存**
模型训练好了,但实际运行时还有一个工程挑战:视频是无限长度地生成的,而计算机的内存和算力是有限的。如果每生成一帧都要把之前所有帧的信息全部保存和处理,随着视频越来越长,内存会被撑爆,延迟也会越来越高。
研究团队的解决方案叫"滑动窗口解码",原理类似于用一个固定大小的放大镜在一卷无限长的画轴上滑动——放大镜始终只看局部的一段,画轴本身却可以无限延伸。具体来说,每次生成新的一帧时,模型只关注三类信息:第一类是"永久参考上下文",也就是用户上传的第一帧图片和最早生成的第一个视频段,这个参考永远不会被遗忘,就像一个演员始终记得自己饰演的角色的基本设定;第二类是滑动窗口内保留的近期历史帧;第三类是当前正在生成的这一帧。通过这种方式,推理时的计算量是固定的,不会随视频长度增加而增长,从而支持无限时长的生成。
但仅靠滑动窗口还不够,还需要解决"漂移"问题。研究团队为此发明了一种叫"TwinCache(双缓存)"的策略。每一帧生成后,系统会为它保存两个版本的"记忆":一个是带有少量噪声的"嘈杂版",一个是完全干净的"清晰版"。在生成新帧的中间步骤里,历史帧用"嘈杂版"来提供参考——带噪声的记忆就像一个粗略的轮廓,它能传递大致的动态信息,同时又不会把历史帧的每一个细节都强行复制到新帧上,这样即使之前的帧有小错误,也不会被精确地放大传递下去。只在生成过程的最后一步,系统才切换到"清晰版"历史帧,把精细的外观细节和身份特征补回来。这个过程像是先用铅笔轻轻勾出大概的姿势,等位置定好了再用钢笔把五官和细节画清楚,既保证了动作的连贯性,又不会因为太依赖历史细节而把错误一代代传下去。
此外,研究团队还对位置编码做了优化。AI模型需要知道每一帧在整段视频里处于什么位置,就像书上的页码,但当视频无限延伸时,页码会越来越大,超出训练时见过的范围,导致模型懵掉。团队采用的策略是把历史帧的位置信息缓存起来,每次滑动窗口前进时,重新计算相对位置,让所有可见的帧的位置编号始终处于模型在训练时见过的合理范围内,避免"页码越界"的问题。
**四、让计算快到飞起:硬件与软件的联合提速**
再好的模型如果跑得太慢,也是空谈。Vidu S1能在普通消费级显卡上达到每秒42帧,背后有一整套软硬件协同加速的工程设计,研究团队把这套技术称为TurboDiffusion和TurboServe。
注意力机制是扩散模型中最耗时的计算环节,可以理解为AI在生成每一帧时需要"同时关注"画面里所有位置之间的关系,计算量随画面大小呈平方级增长。团队引入了三种互补的注意力加速方法:SageAttention利用8位整数精度做快速近似计算;SpargeAttention发现注意力矩阵中大部分数值很小、可以跳过不算,只专注于真正重要的位置;Sparse-Linear Attention则进一步把部分注意力计算替换为更轻量的线性近似。三者联手,大幅削减注意力环节的延迟。
除了注意力,模型里大量的矩阵乘法运算(也就是"线性层计算")也是耗时大户。量化是常见的加速手段,原理是用精度更低的数字格式来存储和计算模型参数,就像把精确到小数点后十位的数字四舍五入到小数点后两位,运算更快但可能损失精度。然而,团队发现通常使用的"按整个矩阵"或"按每一行"量化的方式,容易受到少数极端值的干扰——就像班级平均分被几个满分学生拉高,其他人的分数被压缩到一起,无法区分。为此,团队专门实现了一种更细粒度的"按块"量化方案,把矩阵分成小块,每块独立量化,有效避免了极端值的污染,在保持精度的同时显著减少了内存占用和计算时间。
运算符融合是另一个加速手段。AI推理过程中有大量细小的计算步骤需要逐一调度执行,每次调度都有开销,就像工厂流水线上的每道工序之间都有搬运时间。团队把多个相邻的小步骤合并成一个大步骤,减少调度次数,也避免了中间结果需要反复写入和读出内存。
针对推理过程结构固定、重复执行的特点,团队还使用了CUDA图技术,把一次推理涉及的所有GPU计算步骤预先"录制"成一个固定的执行剧本,后续每次推理只需"重放"这个剧本,省去了每次重新排列调度的开销,让GPU始终保持高负载运行。
当单张显卡算力不足时,系统会把计算分散到多张显卡上并行处理。采用的是一种叫"Ulysses风格上下文并行"的方案,每张显卡只处理一部分序列切片,处理完毕后通过显卡间的集合通信把结果汇总和重新分配,实现算力的横向扩展。
**五、实验结果:各项指标均达最优**
研究团队在两个基准上验证了Vidu S1的性能。一个是公认的标准公开测试集HDTF,另一个是团队自行构建的Vidu-StreamBench,后者包含500个测试样本,每个样本由一条动作指令、一张参考图片和一段音频组成,覆盖多种动作类型、图像风格、说话人属性、情绪状态和应用场景,专门用来测试模型在实时互动场景下的综合表现。
对比的竞品包括三个主流商业系统HeyGen、LemonSlice和Kling Avatar 2.0,以及多个开源研究模型,包括OmniAvatar-1.3B、StableAvatar-1.3B、Hallo3、Wan2.2-S2V-14B和LiveAvatar。评价指标主要有三个:CSIM衡量生成视频与参考图片中人物的身份相似度,数值越高越好;Sync-D衡量音频和嘴型的同步误差,数值越低越好;DOVER衡量视频的整体感知质量,数值越高越好。
在HDTF上,Vidu S1在所有三个指标上均达到最优:CSIM为0.9192(身份保持最好),Sync-D为7.847(音画同步误差最小),DOVER为0.5660(视觉质量最高)。与此同时,Vidu S1是所有对比系统中唯一既支持实时生成又支持指令控制的系统,在分辨率(960×540)和帧率(42 FPS)上也远超其他所有竞品。
在Vidu-StreamBench上进行的人类偏好对比测试结果同样突出。与HeyGen相比,人类评测者在总体偏好、动作流畅度、身份一致性、音画同步和动作可控性五个维度中,有四个维度更倾向于Vidu S1,其中在"动作可控性"这个维度,Vidu S1获得了100%的偏好率,没有一位评测者在这个维度上选择HeyGen,这说明当任务要求虚拟人物准确执行用户发出的具体动作指令时,Vidu S1的表现碾压性地优于竞品。与LemonSlice的对比中,Vidu S1同样在动作可控性上取得100%偏好率,动作流畅度和音画同步方面也有明显优势。与更注重指令控制的Kling Avatar 2.0相比,Vidu S1在动作可控性、动作流畅度和音画同步三个维度均胜出。
从定性的视觉对比来看,给定同一张参考图片和同一个动作指令"抬起头,做出若有所思的姿势",Kling Avatar 2.0生成的结果中人物头部没有明显抬起,背景还出现了可见的伪影;Vidu S1则准确地完成了抬头动作,背景保持稳定,画面整洁。另一个指令"举起一只手,做出竖大拇指的手势",Kling Avatar 2.0的生成结果中手势动作不正确,而Vidu S1成功且自然地完成了竖大拇指的动作。
这些结果共同说明,Vidu S1不只是"更快"的视频生成系统,而是在保持高质量的前提下,真正实现了用户可以随时发话、画面随时响应的实时互动体验。
**说到底,这意味着什么**
归根结底,Vidu S1解决的是一个很真实的需求:人们希望和屏幕里的虚拟形象进行真正的双向交流,而不是单方面地观看一段预先生成好的视频。这项技术一旦成熟,虚拟主播可以实时响应观众的语音互动,在线教育中的AI老师可以根据学生的口头提问即时变换表情和手势,游戏中的NPC(非玩家角色)可以像真人一样听从玩家的口头指令做出动作,个人化虚拟助手可以以一张你自己上传的照片为原型,用你选定的声音风格,24小时不间断地与你实时互动。
当然,目前Vidu S1仍处于研究阶段,现阶段主要面向单人正面视角的虚拟角色,应对的场景也集中在语音驱动的肢体动作和表情变化,距离全场景的通用实时虚拟人还有一定距离。但它已经证明了一件事:实时互动视频生成不是遥不可及的未来概念,而是现在就能在普通消费级硬件上跑起来的现实。
对这个方向感兴趣的读者可以通过arXiv编号arXiv:2607.03118查阅完整论文,也可以访问团队提供的在线演示地址体验实际效果。
---
Q&A
Q1:Vidu S1和普通的AI视频生成模型有什么本质区别?
A:普通的AI视频生成模型采用"离线生成"模式,用户提交指令后需要等待几分钟甚至更长时间才能拿到完整视频,过程中无法干预。Vidu S1则支持实时互动,用户在视频生成过程中的任意时刻都可以用语音发出新指令,虚拟人物会立刻做出对应的动作,整个过程没有等待,就像和真人面对面交流一样。此外,Vidu S1还能无限续写视频而不会出现画面崩坏,这是大多数现有模型做不到的。
Q2:Vidu S1是怎么防止长视频越来越模糊、越来越崩坏的?
A:Vidu S1采用了两个关键设计。第一是"滑动窗口解码",让模型每次只看固定长度的历史信息,计算量不随视频变长而增加。第二是"TwinCache双缓存"策略,为每一帧同时保留带噪声的粗略版本和完全清晰的精细版本,生成中间步骤时用粗略版本引导大致动态,避免历史错误被精确复制放大,只在最后一步才用清晰版本补回细节,从而兼顾连贯性和视觉质量。
Q3:Vidu S1支持哪些类型的虚拟角色和控制指令?
A:Vidu S1支持多种风格的虚拟角色,包括真实人物形象、动漫风格角色和宠物形象,用户可以上传自己的图片作为参考来创建个性化虚拟人,还可以选择不同的声音风格。在控制指令方面,系统支持通过语音发出具体的肢体动作指令,比如挥手、比心、竖大拇指、抬腿、坐下等,虚拟人物会实时响应并执行这些动作,同时保持与用户提供音频的嘴型同步。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。