
这项由中国科学技术大学、上海人工智能实验室、香港城市大学、南京大学、复旦大学、浙江大学及电子科技大学联合开展的研究,以预印本形式于2026年6月发布,论文编号为arXiv:2606.05769,感兴趣的读者可以通过该编号查询完整论文。
一、 先从一个你一定熟悉的场景说起
你正在看一场篮球赛的录像,画面突然停住了。屏幕上,一名球员正持球向篮下突破,另一名穿黑色球衣的球员快步赶来。录像就停在这里,问题来了:接下来会发生什么?
对人类来说,这个问题几乎是本能反应——我们会在脑子里"播放"一段想象的画面,预感到可能会有一个扣篮,或者一次盖帽。这种"在脑海里看未来"的能力,其实是人类理解世界的核心技能之一。
然而,对于现在最先进的AI视频理解模型来说,这件事一直是块难啃的骨头。研究团队把这类问题称为"视频事件预测"——给AI看一段视频的前半段,让它预测后面会发生什么。这听起来简单,但AI的表现却一直不尽如人意。
问题的根源,恰恰出在AI"思考"的方式上。
现有的AI模型在预测未来时,通常是把看到的画面翻译成文字,然后用文字来推理。好比你要预测一盘棋的走势,却不看棋盘,只是把每颗棋子的位置念出来,再在脑子里用文字描述来推算。这个过程中,大量关于位置、动作、速度的细节信息,在从"画面"翻译到"文字"的过程中悄悄丢失了。
研究团队给这个问题起了个贴切的名字:"视觉幻觉"——AI说得头头是道,听起来很有道理,但其实已经偏离了画面里真实发生的事情。
这项研究的核心突破,就是教会AI一种全新的思考方式:**边推理,边在脑海里"播放"未来的画面**。这个系统被命名为FUTURE-L1。
二、 AI的两种"思考方式",以及第三种
在理解FUTURE-L1的独特之处之前,有必要先了解一下AI预测未来的两条老路,以及它们各自的问题。
第一条路是"纯文字推理"。AI把视频里的画面描述成文字,然后像写作文一样,一句话接一句话地推理接下来会发生什么。这就像一个从没看过篮球赛的解说员,只凭别人的文字描述来猜测比赛走向。文字描述再详细,也无法完整传达运动员的体位、速度、眼神方向这些视觉细节。最后推理出的答案,往往"逻辑上说得通,但画面上对不上"。
第二条路是"生成未来视频"。与其猜测,不如直接把未来的样子生成出来,看着视频来预测。这个思路在理论上无懈可击,但代价是极其高昂的计算开销。生成高质量视频需要消耗大量算力,仅仅为了回答"下一秒会发生什么"就要生成一整段视频,显然得不偿失。
FUTURE-L1走的是第三条路——它既不把画面翻译成文字,也不生成完整的视频帧,而是在推理过程中,在"文字思考"和"视觉感知"之间来回切换,产生一种叫做"潜在视觉片段"的中间状态。
用一个生活中的比喻来理解:这就好比一个画家在构思一幅画时,不是一直盯着空白画布写文字描述,也不是直接动笔把整幅画画出来,而是在脑子里快速"闪现"一系列粗略的视觉草稿——不需要每个细节都完整,只需要保留住关键的位置关系、动作方向和空间感——然后基于这些草稿,再用文字来组织最终的想法。
这些"视觉草稿",就是FUTURE-L1里所谓的"潜在视觉片段"。它们不是真实的图像,而是一种介于图像和文字之间的连续数值状态,既保留了视觉上的精细信息,又不需要生成完整的像素画面。
三、 训练AI"先想象再预测"的两个阶段
教会AI这种新思维方式,并非一蹴而就。研究团队设计了一套两阶段的训练方案,第一阶段打好基础,第二阶段精炼提升。
**第一阶段:精挑细选的"视觉增益"训练集**
研究团队首先需要准备训练数据。他们从一个叫TwiFF-2.7M的大型数据库出发,这个数据库里包含大量视频片段和对应的推理轨迹,还附带了视频未来时刻的真实画面作为"提示"。
然而,并非所有这些数据都值得用来训练。有些视频问题太简单,不用看未来的画面也能猜个八九不离十;有些则相反,就算给了未来画面的提示,模型依然一头雾水,毫无帮助。把这两类数据喂给AI,不仅浪费计算资源,还会让AI学坏——它会觉得"视觉想象"这件事没什么用。
于是,研究团队设计了一个筛选机制,他们称之为"视觉增益"过滤。具体做法是:对每道题目运行两次测试,一次只给视频前缀和文字问题,另一次还额外提供视频未来时刻的真实截图作为提示。每次测试各独立猜8次,记录猜对的次数。如果不给视觉提示时猜对超过6次,说明这道题太简单,不用;如果给了视觉提示之后猜对的次数比不给时多2次或以上,说明视觉信息真的有帮助,这道题就保留。
最终按照"视觉增益"从高到低排序,取出前5万道题目,构成了FUTURE-L1-50K这个精华训练集。
然后,研究团队重新整理了这些数据的格式。每道训练题不再是简单的"看视频,回答问题",而是一个交织了文字推理和视觉片段的完整轨迹:先用文字分析一段,然后插入一个"视觉思考区间",再用文字分析一段,再插入视觉片段,最后给出答案。就像一个聪明的球评员,一边用文字解说局势,一边脑子里不断闪过几个关键画面,帮助自己判断接下来的走势。
在训练时,对于文字部分,AI学习的目标是"下一个字是什么",这是标准的语言模型训练。对于视觉片段部分,训练目标则是让AI生成的连续数值状态,尽可能接近视频真实未来帧经过视觉编码器处理后得到的特征向量。说得通俗一点,就是让AI脑子里想象的"未来画面",在数学结构上尽量贴近真实会发生的画面。
**第二阶段:用强化学习精炼"想象力"**
第一阶段的训练像是在模仿老师给的标准答案,AI学会了"什么时候该想象,怎么想象",但这种模仿式学习有个天然的局限:它优化的是模仿的准确度,而不是最终预测的对不对。
第二阶段,研究团队引入了一套叫做LA-DAPO的强化学习方法。强化学习的核心逻辑类似于"试错学习":AI自己做出很多次尝试,根据每次尝试的结果好坏来调整自己的策略。
LA-DAPO在基础的答题奖励(答对了给奖励,答错了扣分)之上,额外增加了两种专门针对视觉想象过程的奖励机制。
第一种叫"结果对比奖励"。在每次强化学习的迭代中,AI会对同一道题目尝试多次,其中有些尝试最终答对了,有些答错了。研究团队发现,如果只给最终答案打分,AI对视觉想象片段的约束依然很弱——它可能在视觉片段里随便想一些东西,靠文字推理答对了题目,视觉片段反而没发挥作用。结果对比奖励的设计是:把答对的那些尝试里的视觉轨迹拉在一起,把答错的轨迹作为对比,鼓励AI让"想对了的视觉想象"在数学上更相似,让"想错了的视觉想象"与之区分开来。
第二种叫"时序多样性奖励"。这个奖励专门防止AI"偷懒"——有时候AI会在连续几个视觉片段里重复想象几乎一模一样的画面,相当于把同一个"草稿"复制了好几遍。这样虽然不影响答案,却浪费了视觉想象的资源。时序多样性奖励要求:相邻的视觉片段应该代表不同的视觉状态,惩罚那些前后高度重复的想象内容,鼓励AI的视觉思考随时间推进而真正演变。
两种奖励加上基础的答题奖励,构成了FUTURE-L1完整的训练信号。
四、 测试结果:差距大到令人吃惊
研究团队在两个专门评测视频事件预测能力的基准上验证了FUTURE-L1的效果。
第一个叫FutureBench,是一个选择题形式的测评,给AI看视频前缀,让它从四个选项里选出最可能发生的后续事件。这个测评还特别设计了四种难度等级:1-Hop只要求预测紧接下来的一件事;2-Hop和3-Hop要求预测更长的事件链;Interp.最难,要求在已知部分中间事件的情况下,推断那些跳过的未观测环节。
在FutureBench上,各路强手的成绩排成一列,差距一目了然。OpenAI的GPT-4o得了59分,GPT-5得了57.9分(是的,在这道题上GPT-5甚至不如GPT-4o)。专门为视频推理设计的Video-CoE是之前最好的成绩,达到了75分。而FUTURE-L1在经过强化学习之后,达到了85.4分,把Video-CoE甩开了10.4分。
更有说服力的是,研究团队还做了一个对照实验:用完全相同的5万条训练数据,但训练一个只用文字推理、没有视觉想象能力的版本。这个"纯文字"版本最终只得了65分。这意味着,8.4分的差距(65分到73.2分的SFT阶段)纯粹来自于"视觉想象"这个能力本身,而不是因为训练数据更好。
难度越高的题目,FUTURE-L1相对原始模型的提升越明显。在最难的Interp.题型上,提升幅度高达29.3分。这说明视觉想象对于需要推断"跳过的未来"这类场景,帮助尤为突出。
第二个叫TwiFF-Bench,是开放式问答,评分范围0到5,同时评估推理过程的质量和最终答案的准确性。FUTURE-L1将平均分从2.44提升到了3.04,超过了此前专门在大规模TwiFF数据上训练的模型(2.79分)。
五、 每一个设计决策的背后,都有数据支撑
FUTURE-L1的设计里,有几个关键的超参数选择,研究团队都做了系统性的消融实验来验证。
关于视觉想象片段的"分辨率",研究团队测试了不同的监督强度——用λ这个参数控制视觉片段需要多接近真实未来帧的特征。λ太小(比如0.01),视觉片段约束太弱,AI的想象天马行空,与真实未来脱节,得分只有69.1。λ太大(比如1.0),视觉片段被死死钉在真实未来帧上,AI失去了灵活想象的空间,得分降到69.5。最优的λ=0.1,让视觉想象有足够的灵活性,同时保持与真实未来的牵引,达到了73.2分。
关于每个视觉片段的"长度",研究团队测试了从2到64个连续视觉状态的范围。片段太短(2个),信息太少,得分70.7。片段太长(64个),反而更差,只有67.4分。最优是4个状态的片段,得分73.2。这个结果很有意思——它说明视觉想象不是越精细越好,短而精准的视觉片段反而比冗长的更有效。
关于视觉想象的数量,AI不会每道题都用固定数量的视觉片段,而是根据题目难度自动调整。在最简单的1-Hop题目上,平均使用1.79个视觉片段;在最难的3-Hop题目上,平均使用2.52个,而且使用3个以上视觉片段的情况从6%增加到21%。AI自发学会了"越难的题用越多的视觉想象",这种适应性并没有被人为设计进去,而是从训练数据中自然涌现的。
六、 意外的收获:更快、更省
研究团队在比较推理效率时,发现了一个出乎意料的结论:FUTURE-L1不仅答得更准,而且还更快。
Video-R1平均每道题要生成398.5个文字标记,用时3.28秒,准确率63.3分。Video-o3的策略更重,平均用时25.9秒,准确率68.9分。相比之下,FUTURE-L1平均只需195.3个文字标记,用时0.91秒,准确率85.4分。
这个结论反直觉,但细想很合理。文字推理的"思考链"通常很长——AI会把每一个视觉细节都用文字描述出来,反复确认,然后才得出结论。而视觉想象片段是连续数值状态,不需要展开成文字,信息密度更高,传递同样多的视觉语义所需的"篇幅"更短。FUTURE-L1用更紧凑的方式思考,反而绕开了大量冗余的文字叙述。
七、 从内部看:AI的视觉想象真的在"进化"吗
研究团队还用可视化手段检验了一个核心问题:AI在一次推理过程中产生的多个视觉片段,是真的代表不同的视觉状态,还是只是同一个状态的重复?
他们把FUTURE-L1在推理过程中产生的所有向量(文字标记、视觉感知标记、第一个视觉片段、第二个视觉片段、第三个、第四个),用降维可视化技术(t-SNE)投影到二维平面上。结果显示:文字和视觉感知标记形成了两个各自独立的区域,而四个顺序的视觉片段则形成了四个彼此分离的小簇,每个簇都与其他簇保持距离。
这说明AI的视觉想象确实在随着推理的推进而演化,不是原地踏步。第一个视觉片段代表一种视觉假设,第二个代表更新后的状态,第三个、第四个依次递进,构成了一条有方向感的想象轨迹。
在训练动态上,研究团队对比了FUTURE-L1与标准DAPO强化学习的奖励曲线。FUTURE-L1在整体奖励、答题准确率、格式规范性以及视觉对比奖励四个维度上,全程保持比DAPO更高、更稳定的上升趋势。
八、 失败案例也值得一看
研究团队没有只展示成功的例子,还诚实地列出了一个典型的失败案例。一段关于棒球队和金毛寻回犬的视频里,正确答案包含了几个非常具体的场景:金毛趴在写着"BASEBALL"字样的地毯上、打开冰箱探头进去、进入球员休息区。FUTURE-L1识别出了"棒球队+金毛犬"的大背景,但预测的是一个更通用的故事情节,完全没有捕捉到这些具体的物品和场景细节。
研究团队指出,这个失败说明"学会在对的时候激活视觉想象"是一回事,"让视觉想象里保留住具体的事件细节"又是另一回事。强化学习阶段的结果对比奖励正是为了解决这个问题而设计的,但从这个失败案例来看,这仍然是一个有待提升的方向。
说到底,FUTURE-L1做的事情,是给AI安装了一种之前从未有过的认知能力——在推理的中途,可以在脑子里快速"闪现"视觉场景,而不是非得把所有思考都转化成文字才能继续推理。这个改变看起来只是一个技术细节,却带来了令人印象深刻的效果提升。
更深远的意义或许在于:这项研究提供了一个证据,说明对于那些本质上是视觉性的任务,强迫AI用语言来思考未必是最好的选择。未来的AI系统,可能会根据任务的性质,在语言思维和视觉思维之间灵活切换,就像人类既会用文字描述,也会在脑子里播放画面一样。
感兴趣深入了解技术细节的读者,可以通过arXiv编号2606.05769查阅完整论文。
Q&A
Q1:FUTURE-L1和普通视频理解AI的根本区别是什么?
A:普通视频AI在推理时只使用文字,把画面翻译成文字再推理,容易丢失运动、位置等视觉细节。FUTURE-L1在推理过程中会插入"潜在视觉片段",这是一种介于图像和文字之间的连续数值状态,能保留视觉细节同时不需要生成完整视频帧,相当于AI边思考边在脑子里"闪现"未来画面。
Q2:LA-DAPO强化学习里的"时序多样性奖励"具体解决了什么问题?
A:它解决了AI在连续推理中"偷懒"的问题——AI有时会在多个视觉想象片段里重复生成几乎相同的内容,相当于把同一张草稿复制多遍。时序多样性奖励惩罚相邻视觉片段之间的高度相似性,强制要求每次视觉想象都要代表不同的未来状态,让整个想象过程真正随时间推进而演化。
Q3:FUTURE-L1-50K训练数据是怎么筛选出来的?
A:从TwiFF-2.7M数据库出发,对每道题做两次测试:一次不给视觉提示,一次给真实未来帧作为提示,各猜8次。保留那些不给提示时猜对不超过6次(说明题目不太简单)、且给提示后猜对次数比不给时多至少2次(说明视觉信息真的有帮助)的题目,按视觉增益高低排序取前5万条。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。