你有没有玩过那种让人抓狂的游戏或者用过让人失望的AI视频工具:你往前走,转个身再回头,刚才明明看到的那扇窗户不见了,墙上的画换了颜色,甚至整个房间的布局都变了。
这不是bug,这是当下几乎所有视频世界模型的通病。
视频世界模型是什么
一句话概括:给AI一张图片或一段文字描述,它能像游戏引擎一样,根据你的方向键实时生成你"看到"的画面,让你在一个AI凭空造出来的世界里自由走动。
这个赛道这两年热得发烫,Genie系列、Oasis、Yume等一堆模型你方唱罢我登场,卖点都差不多:给你一个能探索的虚拟世界。但几乎所有这些模型都有同一个软肋,就是记性差。你往前走了十几秒,回头一看,世界已经"忘了"自己刚才生成过什么,画面对不上了。
这篇来自腾讯ARC实验室和北京大学团队的论文,titled WorldCrafter,就是奔着这个软肋去的。他们给视频世界模型装了一个"记忆系统",让AI生成的世界真的能记住你去过的地方、见过的东西。
记性差到底有多差,差在哪
先说清楚这个问题到底有多棘手。
视频生成模型本质上是一帧一帧往外吐画面的,为了让计算量可控,它通常只能看到最近的几帧、十几帧画面作为"上下文",超出这个窗口的内容就被丢掉了。这就好比你和一个只有七秒记忆的人聊天,聊到第八句话的时候,他已经忘了第一句你说了什么。
直接的解决办法是让AI记住所有历史画面,也就是论文里提到的全历史注意力机制(一种让模型能够回看之前每一帧内容的计算方式,代价是历史越长,需要处理的信息量越大,计算成本随之飙升)。
但这个办法的代价大到没法用。想象你要求一个人记住这辈子看过的每一张照片的每一个像素,并且在每次说话前都要把这些照片全部重新看一遍,找出相关的部分。信息越积累越多,反应速度就越慢,几分钟的探索都撑不住,更别说实时交互了。
于是业界琢磨出另一条路:不记全部,挑重点记。比如根据当前摄像机的朝向,去历史里挑几帧"看起来相关"的画面塞进模型。这个思路听起来合理,但问题在于,挑选往往只依据镜头角度的相似度,挑出来的画面覆盖面窄,一旦挑漏了关键信息,生成出来的画面照样对不上。
还有一条路是做显式的三维空间记忆,用深度估计的方式把历史画面变换到目标视角,直接拼进输入里去。这种方法在静态场景里效果不错,因为空间对应关系是准的,但一遇到会动的猫、会飘的气球这种动态内容,这种强行对齐反而成了枷锁,模型的想象力被捆住了,没法合理地推演场景里正在发生的动态变化。
论文还提到一类几何感知的隐式记忆方法,借助像VGGT这样的预训练几何估计器提取特征作为记忆。
VGGT:一种视觉几何基础Transformer模型,擅长从多视角图片里估计物体的三维几何结构。
这类方法的问题在于,几何估计器训练时优化的目标是"把空间结构算对",而不是"把画面颜色纹理还原得像"。一个只练过做几何测量的人,未必擅长画一幅逼真的画。
WorldCrafter的思路:先学会认路,再学会记路
WorldCrafter团队的出发点是这样的:与其从头训练一个记忆模块,不如站在一个已经很懂"如何用少量视角重建场景外观和结构"的模型肩膀上。
他们选中的底座是LagerNVS,一个专门做新视角合成(Novel View Synthesis,简称NVS,指的是根据已有的几张照片,生成任意一个新的观察角度下场景应该长什么样子)的神经网络。这类模型天生要同时兼顾几何和外观,因为它的训练目标就是让合成出来的新视角画面看起来逼真,这正好补上了纯几何估计器缺的那一课。
WorldCrafter把这个预训练好的编码器搬过来,改造成一个记忆编码器,用它把历史生成的画面压缩成一份紧凑的、带三维感知能力的记忆表示,然后再联合视频生成模型(术语叫DiT,全称Diffusion Transformer,一种目前视频生成领域主流的去噪网络架构,负责把噪声一步步"雕刻"成清晰画面)一起训练,让这份记忆和生成模型的语言真正对上号。
这里有个细节特别值得说一下。论文做了个对照实验:把记忆编码器冻结住不参与训练,只训练后面的读取模块。结果发现效果明显打折扣,验证集上的误差下降得更慢,最终收敛的水平也更差。这说明记忆表示不能是一个提前钉死的规格,得让它跟着生成模型一起磨合,才能真正被用好。
这就像请一位新翻译加入跨国团队。如果只让他背熟词典就上岗,永远听不懂团队内部的行话和梗;只有让他真正泡在团队里,跟着大家一起开会一起磨合,他的翻译才会越来越贴合团队实际需要的表达方式。如果不联合训练,代价是这份记忆表示始终是"正确但不好用"的,就像单词翻译得再准,团队还是觉得他说话别扭。
记忆怎么写进去:挑历史画面这件事也有讲究
光有一个聪明的编码器还不够,喂给它什么样的历史画面同样关键。
论文里提出了一个叫最大覆盖历史检索的策略。简单说,当AI准备生成下一段画面时,它不是简单地找几张"看起来最像"当前视角的历史帧,而是主动挑选一组能够联合覆盖住即将要看到的区域的历史帧组合。
这和之前那些"按相似度排名取前几名"的方法比,差别在哪?
打个比方,如果你要给朋友描述一座城市的全貌,你不会只挑几张角度差不多的照片给他看,那样他顶多知道某个街角长什么样。你会有意识地挑一张俯瞰图、一张主干道照片、一张地标建筑照片,让这几张照片合在一起尽量覆盖整座城市的信息。如果只按"相似度"选片,选出来的几张照片可能内容高度重叠,浪费了宝贵的展示名额,反而漏掉了朋友接下来真正想去的那片区域。
论文的消融实验证实了这一点:把最大覆盖检索换成简单的相似度排序检索后,各项一致性和摄像机控制精度指标都出现了下降。
记忆怎么读出来:让目标视角来"点菜"
写进去的记忆是一堆压缩过的表征,接下来要解决的问题是,怎么从这堆表征里挑出对当前生成任务真正有用的部分,塞进一个数量固定的信息槽位里。
这里论文对比了两种读取方式。第一种叫姿态无关读取,就是不管接下来要生成的画面是往左看还是往右看,一律用同一套规则去压缩提取记忆,剩下的活交给生成模型自己去大海捞针。第二种叫姿态引导读取,会用即将用到的目标摄像机姿态作为"查询条件"去有针对性地提取记忆。
实验结果很明确,姿态引导读取效果更好,无论是场景一致性还是摄像机控制精度都更胜一筹。
这个设计的道理也不难理解。假设你去图书馆查资料,图书管理员完全不知道你要查什么主题,只能凭经验随手抓一摞看起来"综合性强"的书给你,你还得自己一本本翻找有用的信息。如果你提前告诉管理员"我要查十九世纪法国绘画史",他就能精准地把相关的几本书递给你,效率天差地别。姿态引导读取干的就是后一件事,让即将要生成的视角提前"点菜",告诉记忆系统我需要哪个方向的信息,记忆系统就按需配送,而不是眉毛胡子一把抓。
如果不这样设计会怎样?论文的消融数据给出了答案,改用姿态无关读取后,旋转误差从13.536涨到18.307,场景一致性指标LPIPS(一种衡量两张图片感知相似度的指标,数值越低说明两张图越像)从0.255涨到0.333,这些数字背后就是画面对不上、镜头跑偏的具体表现。
摄像机怎么控制:让镜头听懂用户的指令
除了记忆,另一个核心问题是让AI乖乖听用户的镜头指挥,你说往左转它就得往左转,而不是自由发挥。
WorldCrafter采用的方案叫做相对相机位置编码,具体实现上借鉴了一种叫UCPE(统一相机位置编码)的技术,通过一条独立的注意力分支,把目标摄像机的旋转、平移这些几何信息,作为一种"位置提示"注入到生成过程里,而且只作用在正在生成的画面上,已经存在的记忆和历史内容不受这个提示干扰。
这样设计的好处在于职责分工清晰:记忆负责告诉模型"这个世界长什么样",姿态编码负责告诉模型"你现在应该往哪儿看",两件事分开处理,互不干扰,反而配合得更顺畅。
让AI实时跑起来:从慢工出细活到边想边说
光有好的记忆机制还不够,如果生成一帧画面要等半天,这套系统就没法用来做实时交互体验。
论文里提到了一个叫分布匹配蒸馏(一种把原本需要几十步计算才能生成一张清晰图片的扩散模型,压缩成只需要几步就能出图的加速技术)的方法,把原本需要多轮去噪的采样过程压缩成金字塔式的三级分辨率、每级两步的极简流程。
同时团队还发现了一个有意思的取舍。他们想用合成数据集MIND来提升模型跟随运动主体的能力,比如镜头能稳稳跟住一匹奔跑的马,但合成数据训练出来的模型画面质感会发糊,纹理不够自然。
于是他们干脆训练了两个蒸馏模型:一个专攻画面质感,用真实数据训练,负责去噪的最后一步;另一个专攻运动跟随能力,用合成数据混合训练,负责前面所有步骤。两个模型分工合作,各展所长。这有点像拍电影时找两个替身演员,一个专门负责危险的打斗特技动作,另一个负责需要细腻情感表达的特写镜头,导演根据每个镜头需要的能力去调配合适的人选,而不是逼一个人同时精通所有技能。
最终蒸馏后的WorldCrafter-fast版本,在四张GPU的机器上跑出了每秒16帧的生成速度,基本达到了实时交互的水准。
实验结果说话
论文团队专门搭了一套评测基准,包含145张来自HappyOyster、Project Genie等平台以及GPT-Image生成的图片,涵盖83个动态场景和62个静态场景,每张图配上5条相机轨迹,一共725段测试视频,轨迹长度从528帧到1648帧不等,还特意设计了闭环重访的路线,专门检验AI是否记得住之前看过的画面。
对比的基线模型有8个,都是这个赛道里比较有代表性的选手,包括DreamX-World、Alaya-EVOKE、HY-WorldPlay、Lyra 2.0、Echo-WM、LingBot-World 2、Matrix-Game 3.5、SANA-WM,覆盖了上下文记忆、空间记忆、几何记忆等不同技术路线。
在长时程重访一致性测试中,WorldCrafter把LPIPS指标从表现最好的基线Lyra 2.0的0.487降到了0.255,PSNR(峰值信噪比,数值越高说明画质保真度越好)从14.050提升到18.016,蒸馏后的快速版WorldCrafter-fast表现更进一步,LPIPS只有0.186,PSNR达到20.868。
在摄像机控制精度上,WorldCrafter的旋转误差是13.536,平移误差1.475,相机矩阵误差1.546,三项指标全部拿下第一,蒸馏后的快速版排名第三,速度换精度但依然优于多数竞品。
在VBench视觉质量综合评测上,WorldCrafter拿下了8个维度里的5个最优表现,整体综合分81.910排名第一。
论文中有个效率对比数据特别直观。依赖深度估计做空间记忆的方法,每一个生成片段光是深度估计加图像变换(warp)这两步就要花掉1.346秒,而WorldCrafter的记忆编码加读取一共只要0.062秒,快了21.7倍。这个差距为什么这么大?因为深度估计方法每次都要重新计算精确的三维几何位置,再把历史画面像贴纸一样精确地贴到目标视角上,这个计算量随着精度要求水涨船高。而WorldCrafter直接在压缩后的隐空间里操作,跳过了逐像素级别的几何计算,省下的正是这部分开销。
这就像两种整理老照片的方式。一种是每次翻相册都要重新测量每张照片里物体的准确距离,再一张张精确摆放到相框里对应的位置;另一种是提前把照片压缩成一本索引清晰的小册子,需要时直接翻到对应页码就行。后者慢在建索引的那一次,之后每次查阅都快得多。
局限和留白
论文也坦诚地提到了两个还没解决的问题。
一是特别复杂或者特别长的轨迹下,一致性还是会掉链子,记忆系统不是万能的,走得太远太绕,照样会出岔子。
二是每生成一个新的画面片段,都要把历史重新编码一遍,这带来了额外的延迟。作者提出的一个方向是搞一个流式的、增量式的记忆编码器,新生成的内容来了直接叠加进已有的记忆状态里,不用每次都从头计算,这样能省下重复劳动。
写在后面
读完这篇论文,最触动我的一点是,这个团队没有从零发明一个记忆系统,而是意识到新视角合成这个领域已经有现成的、训练得很好的"懂空间又懂外观"的模型,直接把它借过来改造成记忆编码器。这种"站在已有成果肩膀上"的思路,比从头造轮子聪明得多,也再次说明了一个道理,很多时候突破不是凭空创造出一个新东西,而是发现两个原本各自独立发展的领域之间可以互相借力。
另外一个让我意外的细节是,论文特意花了篇幅讲清楚为什么几何估计器不适合直接拿来做记忆,因为几何估计器的训练目标是把空间结构测量准,不是把画面还原得逼真。这个区分乍一看很细微,但恰恰是决定这篇论文成败的关键判断。如果选错了底座模型,后面所有的联合训练和精巧设计都会建立在错误的地基上。
论文里那个静态场景和动态场景对比的点云重建图也值得多看一眼,尤其是猫在房间里走来走去那组画面,重访时猫的位置、毛色、姿态都对得上,这种细节层面的一致性,恰恰是过去这类模型最容易露馅的地方。
一个还没被回答的问题是,当探索的世界规模继续扩大,历史积累到几十分钟甚至几小时的时候,这套固定预算的记忆机制还能撑住吗?记忆终究是有限的容器,装的东西越多,取舍就越难做,这可能是这条技术路线接下来最值得追问的地方。
Q&A
Q1:WorldCrafter是什么?
A:WorldCrafter是腾讯ARC实验室和北京大学团队提出的视频世界模型,核心创新是给AI装了一个可查询的三维感知记忆系统,让用户在探索AI生成的虚拟场景时,即使转身离开再回来,画面内容依然保持一致,不会出现场景错乱的问题。
Q2:WorldCrafter和其他视频世界模型相比有什么优势?
A:在长时程重访一致性测试中,WorldCrafter把画面相似度误差从最强基线的0.487降到0.255,画质保真度从14.05提升到18.016,摄像机控制精度也是所有对比模型中最好的,同时记忆处理速度比依赖深度估计的方法快21.7倍。
Q3:WorldCrafter能实时交互吗?
A:可以。通过分布匹配蒸馏技术把生成步骤压缩到几步,并训练了低噪声和高噪声两个分工模型分别负责画质和动作跟随能力,蒸馏后的WorldCrafter-fast版本能在四张GPU机器上达到每秒16帧的生成速度,基本满足流畅交互的需求。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。