
这项由香港城市大学计算机科学团队完成的研究,于2026年6月以预印本形式发布在arXiv平台,编号为arXiv:2606.18180。研究成果以数据集论文的形式呈现,项目主页为EgoCS-400K.github.io,感兴趣的读者可通过上述编号查阅完整内容。
现在的AI模型越来越厉害,不仅能生成以假乱真的视频,甚至开始尝试"理解世界"——也就是说,它不只是被动地看画面,而是要搞清楚"我做了这个动作之后,眼前的场景会怎么变化"。这种能力,研究者把它叫做"世界模型"。
但训练这种AI有个非常头疼的问题:它需要的数据,既不同于普通的互联网视频,也不同于机器人操作录像,而是一种非常特殊的"视频+动作+语言"三合一数据——就像一本同时记录了"我看到什么"、"我按了什么键"、"这个场景在语言上怎么描述"的完整日记。这种日记,在现实世界里几乎不可能大规模收集。
香港城市大学的研究团队意识到,职业反恐精英(Counter-Strike,简称CS)比赛的录像文件,恰好具备这种"三合一日记"的所有要素。于是他们花费大量精力,从这些比赛录像中提取出超过40万段第一视角视频,配上精确到每一帧的动作记录、键盘鼠标输入、游戏内状态、事件日志,以及由AI辅助生成的语言描述。这个数据集被命名为EgoCS-400K。
---
一、为什么训练"世界模型"这么难找数据
普通人刷到的短视频、电影、直播,内容丰富多样,但有一个致命缺陷:没有告诉AI"拍摄者在这一刻做了什么"。镜头朝左转,到底是因为人转了头,还是摄像机被搬动了?AI根本不知道。这就像你给一个从没下过棋的朋友看了一万盘棋谱,却从来没告诉他每一步棋是谁下的、为什么下在那里——他看完之后也很难真正学会下棋。
与此对应的另一种数据是机器人操作数据,比如机械臂抓东西的录像。这类数据确实记录了精确的动作,但代价极高——每录一段,都要真实的机械臂、真实的物体、真实的实验室,而且场景单一乏味,AI很难从中学到适用于复杂环境的通用能力。
游戏和模拟器提供了一条折中路线。游戏世界里,所有物理规则都是计算机控制的,动作、状态、事件全部有完整记录。问题在于,大多数游戏数据集要么缺乏大规模的真实人类操作记录,要么画面过于简单,要么场景过于单一,不足以让AI学到真正通用的"世界感知能力"。
香港城市大学的研究团队在寻找突破口时,把目光投向了一种特殊的文件——CS游戏的"demo文件"(也叫录像文件)。这不是普通的游戏视频,而是游戏系统保存的完整"底层回放数据",里面记录了比赛中每一帧(每64分之一秒)里每个玩家的精确坐标、视角朝向、键盘鼠标状态、武器状态、游戏事件等等。基于这个文件,你可以在任意时刻、从任意玩家的视角重新渲染出第一视角视频,而且这个视频和原始的游戏操作是完全对齐的。这就是EgoCS-400K数据集的核心来源。
---
二、CS职业比赛录像为什么是完美原材料
反恐精英系列游戏在全球拥有数以千万计的玩家,职业比赛更是常年有顶级选手参与,比赛录像被完整保存在HLTV等平台上,任何人都可以公开下载。香港城市大学的团队系统性地收集了超过1000场CS:GO和CS2的职业比赛demo文件,涵盖13张不同的地图,包括Mirage、Inferno、Dust2、Ancient、Anubis等经典场景。
每场比赛通常包含若干个回合,每个回合又有最多10名玩家同时在场。研究团队选择了每个回合里所有玩家的第一视角,将每个视角单独渲染成一段视频。这意味着一场比赛的每一个回合,可以产生最多10段不同视角的视频。最终,超过40000个回合、超过10名玩家视角的组合,产生了超过40万段第一视角视频,累计超过10000小时。每段视频的平均时长约为90秒。
为什么说职业选手的数据特别有价值?因为职业选手的操作是有目的的、高质量的人类决策,而不是随机乱按。他们的每一个镜头移动、每一次换枪、每一颗手雷都有战术意图。这让AI学到的不是随机噪声,而是人类在复杂环境中真实的行为模式——快速的视觉搜索、精准的镜头控制、武器切换时机的判断,以及在看不清整个战场(部分可见性)条件下的决策逻辑。这些能力,恰好是现实世界中自主智能体(比如机器人、自动驾驶汽车)也需要具备的核心能力。
---
三、从录像文件到数据集:一条精密的流水线
把一堆比赛录像变成可以用来训练AI的数据,远比听起来复杂。研究团队设计了一条五步走的处理流水线,整个过程高度自动化,但每一步都有精心设计的规则和过滤机制。
整个流程从demo文件的收集开始。每个demo文件都是一个"真相来源",记录着比赛的完整时间线,包括每一轮的开始和结束、每位玩家的身份、坐标、视角、输入状态,以及各种游戏事件。团队使用一个叫做demoparser2的工具,把这些信息解析成结构化的数据文件:ticks.csv记录每一帧的玩家状态,event.csv记录各种离散事件,summary.json存储回合层面的摘要信息。
在数据解析完成的同时,研究团队还需要把视频实际渲染出来。他们使用CS Demo Manager工具结合Counter-Strike客户端,按照元数据指定的玩家视角和时间区间,逐段渲染出第一视角MP4视频。由于CS2的demo文件以每秒64帧的频率记录数据,视频被渲染为每秒32帧,这样每一帧视频都能对应一个确定的时间区间,实现帧级别的精确对齐。渲染出的视频以H.264格式编码,保留音频,并附带完整的元数据。
渲染完成后,还需要经过一轮质量过滤,剔除各种问题录像。最常见的问题包括:录制了观战者视角而非玩家视角、录屏软件出现bug导致视频损坏、视频时长与解析出的时间区间不匹配等。只有通过过滤的视频,才会进入后续的标注流程。
---
四、把"每一帧在干什么"说清楚:多层次标注体系
EgoCS-400K最有价值的部分,不只是视频本身,而是每段视频背后那套精密的多层次标注体系。研究团队设计了五个层次的标注,从最细粒度的每帧状态,一直到完整的语言描述,层层嵌套,相互对应。
最底层是"每帧状态追踪"。对应ticks.csv文件,记录了每一帧里玩家的精确三维坐标、俯仰角和偏转角(也就是镜头朝向的垂直和水平分量)、速度、移动键状态(W/A/S/D、跳跃、蹲伏等)、射击和右键状态、换弹状态、当前武器、弹药数量、是否处于瞄准状态等十多个字段。这一层数据是整个数据集的"原始真相",所有上层标注都基于它推导而来。
在每帧状态的基础上,研究团队实现了键盘鼠标信号的重建。移动键直接来自demo文件的按键位掩码,而鼠标移动则用视角变化来近似:每帧的水平偏转角差值作为鼠标X轴位移,垂直俯仰角差值作为鼠标Y轴位移。这不是硬件层面的真实鼠标计数,但对于描述摄像机运动来说已经足够精确。
第三层是"原子动作提取"。研究团队为各种游戏动作设计了基于规则的检测器,从连续的帧状态变化中提取出有时间边界的动作片段,存储在events.csv中。换枪动作通过检测当前武器字段的变化来识别;换弹动作通过持续检测换弹状态标志来识别;检视武器动作通过武器动画状态来识别;蹲伏动作通过鸭子状态标志和蹲伏量来识别。对于更复杂的手雷使用,研究团队综合了多种信号:活跃手雷状态、射击或右键按下、weapon_fire事件、grenade_thrown事件、弹道飞行区间,以及爆炸或烟雾消散等效果事件,从而产生了"准备扔雷"、"投出手雷"、"手雷飞行"、"手雷效果"四个子阶段的标注,同时保持它们在逻辑上属于同一个高级"扔手雷"动作。
第四层是"动作时间线与保护链"。原子动作片段可能相互重叠或过于细碎,不适合直接用于视频分割。研究团队先把所有原子片段统一映射到视频帧时间轴上,形成可视化的时间线;然后判断哪些动作是"不能被切断的"——比如换枪动画、换弹动画、手雷准备和飞行过程、瞄准镜切换等,如果在这些动作进行中强行切断视频,会产生视觉上或语义上的不完整感。这些不能被切断的时间段被标记为"保护区间",相邻或重叠的保护区间会被合并成一个"保护链"。
第五层,也是最粗粒度的层次,是"训练片段划分"。每段玩家视角录像通常长达90秒,远超单次训练所需的长度。研究团队需要把它切成若干个较短的片段,同时不能把保护链切断。这个问题被抽象为一个最优路径问题,用动态规划算法求解。具体来说,所有不在保护区间内部的时间点都是合法的切割点,研究团队在这些切割点之间规划路径,选出一组切割点,使得所有片段的长度尽可能接近目标时长(默认为4秒),同时避免遗漏覆盖(不留空白)、保证每个动作前有足够的上下文(默认0.5秒的"预热时间",让AI能看到动作发生前的准备过程)。目标时长的约束是软性的,允许片段在2秒到6.5秒之间浮动,以适应保护链的长度变化。最终生成的dp_segments.json记录了每个片段的边界、包含的保护链编号、包含的动作ID等信息。
---
五、让AI用语言描述游戏场景:先验引导的字幕生成
有了视频和结构化的标注,研究团队还需要为每个片段生成语言描述。这是训练语言-视觉-动作模型不可缺少的一环,但也是最容易出问题的环节。
研究团队没有直接把视频扔给一个视觉语言模型(VLM)让它自由发挥,而是设计了一套"先验引导"机制。核心思路是:用从demo文件中解析出的结构化信息作为约束条件,告诉VLM"这段视频里发生了什么动作、玩家怎么移动的、镜头怎么转的",然后让VLM根据这些约束,结合它自己对画面内容的理解,生成描述。
为什么要这样做?因为纯粹依赖VLM的自由描述有两个对立的缺陷。如果没有任何结构化约束,VLM容易漏掉那些视觉上很短暂但游戏上很重要的动作,比如一次快速换枪、一次轻微的镜头调整,或者在换弹时微微蹲身。但如果把所有解析出的原始信号都直接传给VLM,又会产生另一个问题:VLM可能把一个微小的噪声抖动错误地关联到画面里某个显眼的物体上——比如一个轻微向左的视角抖动紧接着一个向右的大转身,如果不过滤掉那个抖动,VLM可能会错误地把"右侧出现的门洞"描述成在"向左看的时候发现的"。
为此,研究团队对三类先验信息分别进行了过滤:
动作先验方面,只保留会产生可见视觉变化的动作,比如换枪、开枪、换弹、检视武器、扔手雷、切换瞄准镜、近战动作、跳跃或蹲伏转换等,而过滤掉那些"无效动作"——比如在换枪动画播放期间的开枪输入,这个输入并不会实际产生射击效果,不应该被描述为"开枪"。
移动先验方面,从每帧的W/A/S/D按键状态提取出连续的移动段,计算每段的位移量和平均速度。如果位移量极小且速度也极低,就认为这是无效的"踩踏"而非真正的移动,予以过滤。剩余的移动段根据位移大小分级描述:小位移描述为"微调位置",大位移映射为"向前移动"、"向后移动"、"横向移动"等方向性标签。
镜头运动先验方面,把每帧的视角变化量按时间分成若干小区间,对每个区间计算水平偏转(左右)和垂直俯仰(上下)的总变化量和绝对变化量的比值。只有当变化量足够大、且方向一致性足够强(即绝对变化量与总变化量的比值接近1)时,才认为这是一个有意义的镜头运动事件,记为"向左转"、"向右转"、"低头"、"抬头"等。
处理完先验后,研究团队构建了一个包含视频片段、动作先验、移动先验、镜头先验和"时间骨架"的完整输入,交给Qwen-VL模型生成字幕。时间骨架是一个按时间顺序排列的动作-移动-镜头事件序列,确保VLM生成的文字描述和结构化先验的时间顺序一致。VLM被要求以严格的JSON格式输出,包含四个字段:scene_draft(场景草稿,分项记录第一视角的视觉细节、环境变化、可见效果和时序事件)、long_prompt(把草稿转化为连贯的视频生成提示词)、confidence(置信度)、flags(标记可能存在问题的地方)。这种输出格式既保留了时间对齐,又允许VLM补充那些只有靠看画面才能知道的视觉细节,比如墙壁材质、光线效果、烟雾遮挡、场景几何结构等。
---
六、数据集长什么样:一个四秒钟的具体例子
论文在qualitative samples部分展示了一个直观的例子,非常能说明EgoCS-400K的标注密度和质量。这是一段来自古代神庙地图(Ancient)的四秒钟片段,时间线大致如下:
片段开始时,玩家站在一堵石墙旁边,视角朝向一个有拱形木门的庭院。在0到0.2秒,玩家从手持小刀切换到一颗高爆手雷(HE Grenade),这个换枪动作被标注为weapon_switch。从0.22秒到1.83秒,玩家持续检视这颗手雷,动作类型为weapon_inspect。在0.58秒到1.27秒之间,玩家还处于空中(airborne),说明他在检视手雷的同时跳起来了。在1.86秒,玩家开始准备投掷手雷(grenade throw_prepare),同时再次腾空。2.30秒,手雷被投出,进入飞行阶段(grenade flight),持续到3.92秒。2.44秒开始,玩家迅速切换到压制型M4A1-S步枪。
这个片段对应的先验引导字幕描述了整个过程:玩家从石墙旁边出发,切换到手雷并检视,沿右侧石路移动,腾空,镜头向上和向右偏转看向树木和上方遗迹,准备投掷手雷并将其释放穿过庭院,随后猛地转向一条通往内室的窄石道,最终换出压制步枪站在石墙旁。与此同时,字幕还补充了环境描述:这是一个光线明亮的古代丛林神庙遗址,有马赛克墙砖、拱形木门、热带植物和阳光照射的庭院,这些全部来自VLM对画面的观察。
这个例子清楚展示了EgoCS-400K的核心价值:在短短四秒内,数据集同时提供了帧级别的键盘鼠标输入、原子动作时间线、保护链划分、以及融合了结构化先验和视觉细节的语言描述,四个维度完全时间对齐,可以相互印证。
---
七、这个数据集能用来干什么
EgoCS-400K被设计为支持多种AI训练任务,研究团队在论文中明确列举了四类主要应用方向。
第一类是"动作条件化未来预测":给AI看前几帧视频和当前的键盘鼠标输入,让它预测接下来画面会怎么变。这是世界模型最核心的能力,而EgoCS-400K正好提供了高质量的"输入-画面变化"对应关系。
第二类是"状态和事件感知的场景展开":考虑游戏状态(当前武器、是否蹲伏、是否空中)和离散事件(刚投出手雷、刚换弹)的情况下,AI生成连续的场景演化视频。这考验AI对游戏逻辑和物理规律的内化程度。
第三类是"可控第一视角视频生成":给定一段语言描述(比如"玩家在古代地图右侧路点向前跑,镜头向右扫视,随后停下换枪"),AI生成对应的第一视角视频片段。这类任务需要模型同时理解语言、游戏逻辑和视觉规律。
第四类是"智能体第一视角动作理解":给AI看一段第一视角视频,让它推断玩家按了什么键、做了什么动作。这是一种"逆向工程"任务,可以用于自动化游戏行为分析、AI辅助训练系统,或者更广泛地迁移到理解人类操作视频的场景中。
---
八、诚实的局限性
研究团队在论文中坦率地指出了几个值得关注的局限性。
最根本的局限在于场景范围。EgoCS-400K里的所有行为都围绕CS游戏的玩法展开——战术移动、瞄准射击、道具使用、快速反应。这些行为确实包含了很多通用的第一视角感知能力,但毕竟不覆盖日常生活中的精细手部操作(比如拿杯子、切菜)、社交互动、家务活动或开放式户外行为。AI在这个数据集上学到的东西,需要进一步迁移训练才能应用于现实世界场景。
另一个局限来自物理规律的差异。CS游戏的物理引擎是高度简化的,武器遵循游戏设计的状态机,场景变化遵循游戏地图的几何结构,而不是真实世界的物理规律。比如玩家不会跌倒,不会被不平整的地面绊倒,子弹的穿透逻辑是预设的规则而非物理模拟。这意味着在这个数据集上训练的世界模型,对"游戏世界如何运作"会有很强的直觉,但这种直觉未必能直接转移到真实的物理环境中。
还有语言描述质量的问题。EgoCS-400K的字幕是由先验引导的VLM自动生成的,不是人工撰写的金标准。虽然结构化先验大幅降低了幻觉和偏差的概率,但VLM仍然可能在视觉细节描述上出现小错误(比如误判武器外观、误判场景光线方向),或者在语言表达上出现轻微的不自然。研究团队为每条字幕附上了confidence和flags字段,方便使用者进行二次筛选和过滤,但使用者仍需对字幕质量保持合理的预期。
---
说到底,EgoCS-400K做的事情,是在"什么都有但动作不清楚的互联网视频"和"动作很清楚但场景太单调的机器人数据"之间,开辟了一条中间路线。职业CS比赛录像凑巧满足了世界模型数据所需的全部特征:有真实人类的高质量决策,有精确到毫秒的动作记录,有视觉丰富的第一视角画面,有完整的状态和事件日志,还有可无限重放重渲染的底层数据。研究团队把这些优点系统性地转化成了40万段标注完备的训练视频,打包成一个可以直接用来训练世界模型的数据集。
当然,这终究是个游戏数据集,它和真正的现实世界之间还有相当距离。但对于正在快速发展的AI视觉世界模型领域来说,能有这样一个大规模、高质量、多维标注的数据集,本身就是一个重要的基础设施。就像在自动驾驶研究早期,研究者们先在模拟赛道上把技术跑通,再逐步迁移到真实道路一样——EgoCS-400K或许就是那条模拟赛道。有兴趣深入了解这套数据集构建方法的读者,可通过arXiv编号2606.18180查阅完整论文。
---
Q&A
Q1:EgoCS-400K里的视频是直接录制游戏画面得到的吗?
A:不完全是。EgoCS-400K的视频是从CS比赛的demo录像文件重新渲染出来的,而不是直接录制游戏过程中的屏幕。demo文件保存了比赛的完整底层轨迹数据,研究团队通过CS Demo Manager工具按指定玩家视角和时间区间重新渲染,确保每一帧视频和解析出的动作数据精确对齐,避免了直接录屏可能带来的时间偏差和画面错误。
Q2:EgoCS-400K的字幕是人工写的吗?
A:不是人工写的,而是由AI视觉语言模型Qwen-VL自动生成的,但有一套"先验引导"机制约束生成内容。研究团队先从demo文件解析出玩家动作、移动模式和镜头运动等结构化信息,对其进行过滤和整理后作为约束条件传给Qwen-VL,让模型在此基础上补充画面的视觉细节。这种方式大幅降低了AI胡说的概率,但字幕仍可能存在轻微的视觉描述错误。
Q3:EgoCS-400K动态规划分割视频片段时的目标时长是多少?
A:默认配置下,目标时长为4秒,允许范围是2秒到6.5秒。动态规划算法会在不切断"保护链"(即换枪、换弹、手雷飞行等不能被中断的动作区间)的前提下,尽量让每个片段贴近4秒目标,同时保证每个动作前有约0.5秒的"预热上下文",让模型能看到动作发生前的准备过程。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。