微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 Meta发布Action100M:让AI真正看懂人类动作的超大规模视频数据集

Meta发布Action100M:让AI真正看懂人类动作的超大规模视频数据集

2026-01-29 10:17
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-01-29 10:17 科技行者

当你拿起水杯喝水、切菜做饭或者修理家具时,这些看起来再平常不过的动作,对人工智能来说却异常复杂。Meta FAIR(Facebook人工智能研究院)联合香港科技大学、阿姆斯特丹大学和索邦大学的研究团队,最近发布了一项突破性成果——Action100M数据集,这是迄今为止最大规模的视频动作理解数据集。这项研究发表于2025年,论文编号为arXiv:2601.10592v1,为AI理解人类动作提供了前所未有的丰富素材。

理解人类动作对AI来说为什么这么难呢?可以把AI比作一个刚来地球的外星人,虽然它能看到人类的各种行为,但要真正理解"为什么要这样做"和"接下来会做什么"却需要大量的学习。比如,当AI看到有人拿起刀具时,它需要判断这个人是在切菜还是在修理东西,是在准备食材还是在清洁工具。这种细致入微的动作理解能力,正是让AI变得真正有用的关键所在。

过去的AI训练就像是让学生只看几本教科书就要应对所有考试一样困难。现有的视频动作数据集规模都比较有限,通常只包含几万到几十万个动作实例,而且往往局限于特定领域,比如只有烹饪视频或者只有玩具组装视频。这就好比让一个孩子只看烹饪节目就要学会所有生活技能一样不现实。

Action100M的出现彻底改变了这种局面。研究团队从120万个教学视频中提取了约1亿4700万个动作片段,相当于14.6年的视频内容。如果把这些视频比作一座图书馆,那么Action100M就像是世界上最大的动作百科全书,涵盖了从简单的"转动螺丝"到复杂的"制作爱尔兰咖啡"等各种层次的人类动作。

更令人惊叹的是,研究团队开发了一套完全自动化的处理流水线,就像一个永不疲倦的图书管理员,能够自动观看这些视频,理解其中的动作,并为每个动作片段生成详细的文字描述。这个过程使用了当前最先进的AI模型,包括V-JEPA 2、PerceptionLM和GPT-OSS-120B等多个专业工具,总共消耗了约130万个V100 GPU小时和30万个H100/H200 GPU小时的计算资源。

一、化繁为简:让AI学会分解复杂动作

Action100M最巧妙的地方在于它的分层理解策略,这就像教孩子学习一样——先学会走,再学会跑,最后学会舞蹈。研究团队开发的系统能够自动将长视频分解成不同时间尺度的片段,从几秒钟的基本动作到几分钟的完整任务。

具体来说,系统首先使用V-JEPA 2模型提取每一帧画面的视觉特征,就像给每张照片贴上一个描述性标签。然后采用分层聚类算法,自动识别视频中动作的自然分界点。这个过程类似于一位经验丰富的剪辑师在观看素材时,能够敏锐地感知到一个动作结束、另一个动作开始的时刻。

例如,在一个制作杏仁酱的教学视频中,系统能够自动识别出"摊放杏仁"、"烤制杏仁"、"冷却杏仁"、"放入搅拌机"、"搅拌成粉"、"继续搅拌成膏状"、"倒入储存罐"等各个独立步骤。每个步骤既是完整动作序列的一部分,也是可以独立理解的动作单元。

这种分层处理方法的优势在于,它能够同时捕捉到细粒度的手部动作(比如"握住勺子搅拌")和宏观的任务流程(比如"制作杏仁酱")。这就好比学习语言时,我们既要理解单词的含义,也要掌握句子的结构,最终才能理解整篇文章的意思。

二、多角度观察:构建动作的立体画像

仅仅识别动作的时间边界还远远不够,就像仅仅知道电影的分镜头表还不足以理解整部电影一样。Action100M采用了一种被称为"Tree-of-Captions"(标题树)的创新方法,为每个动作片段构建多层次、多角度的描述。

这个过程就像一个专业的新闻团队在报道同一个事件时,会有摄影师拍摄关键画面,记者撰写详细报道,编辑提炼核心要点。系统首先使用Llama-3.2-Vision-11B模型为每个动作片段的关键帧生成图像描述,捕捉静态的视觉细节,比如"一位女性站在明亮的厨房里,手持木勺"。然后使用Perception-LM-3B模型分析整个动作序列,描述动态过程,比如"她将木勺插入锅中,以顺时针方向搅拌浓稠的混合物"。

这些不同层面的描述信息随后被送入GPT-OSS-120B这个大型推理模型,就像一位经验丰富的编辑在整合来自不同记者的报道一样。系统会进行三轮自我完善处理,不断核对和修正描述内容,确保最终输出的动作标注既准确又详细。

最终,每个动作片段都会获得五个维度的结构化描述:简短动作描述(比如"搅拌混合物")、详细动作描述(比如"用木勺以顺时针方向持续搅拌锅中的浓稠混合物")、动作执行者(比如"穿着围裙的女性")、简短视频标题(比如"在厨房制作食物")和详细视频标题(比如"视频显示一位女性在明亮的厨房中制作杏仁酱的完整过程")。

三、规模空前:百万级视频的海量知识库

Action100M的规模之大令人叹为观止。数据集基于HowTo100M收集的120万个YouTube教学视频构建,这些视频涵盖了WikiHow网站上12个主要类别的活动,包括食物与娱乐、家居与花园、爱好与手工等各个领域,但排除了较为抽象的类别如人际关系或金融理财。

从统计数据可以看出,这个数据集的丰富程度达到了前所未有的水平。最终生成的1.47亿个动作片段标注包含了总计212.7亿个英文单词,如果按照平均阅读速度计算,一个人要不间断阅读几十年才能看完所有描述文字。

数据集中的视频时长分布也很有趣:64%的动作片段持续时间在0到3秒之间,这些通常是基本的手部动作或物体操作;23.8%的片段持续3到10秒,通常对应一个完整的操作步骤;10.2%的片段持续10秒到1分钟,这些往往是复杂的多步骤任务;只有约2%的片段超过1分钟,这些通常是整个教学过程的总结性描述。

通过对动作描述词汇的分析,可以发现数据集很好地反映了日常生活的真实情况。最常见的动作词汇包括"add"(添加)、"stir"(搅拌)、"speak"(说话)、"demonstrate"(演示)等,而最常见的动作组合包括"speak to camera"(对着镜头说话)、"stir mixture"(搅拌混合物)、"add ingredients"(添加配料)等。

四、实战检验:从理论到应用的跨越

拥有了如此庞大的数据集,关键问题是:它真的有用吗?研究团队通过训练VL-JEPA(视觉-语言联合嵌入预测架构)模型来验证Action100M的价值。这个过程就像让一个学生用这套超级教材来学习,然后参加各种考试检验学习效果。

VL-JEPA的训练采用了三阶段策略。第一阶段类似于学前教育,使用静态图片进行基础视觉理解训练,让模型学会识别物体、人物和基本场景。第二阶段进入正式的动作学习,使用Action100M数据集进行8帧视频的训练,让模型开始理解动作的时序特征。第三阶段是高级训练,将输入扩展到32帧,并解冻视觉编码器进行端到端的精细调优。

测试结果令人印象深刻。在八个不同的动作识别任务中,使用Action100M训练的VL-JEPA模型表现优异,特别是在运动导向的任务上表现突出,比如Something-Something-v2、EPIC-KITCHENS-100和EgoExo4D等数据集。这些任务要求模型能够理解细致的手部动作和物体交互,正是Action100M的强项所在。

更重要的是,实验清晰地展示了数据规模的重要性。随着训练数据量的增加,模型性能持续改善,呈现出明显的"scaling law"(规模定律)效应。这就像学习语言一样,接触的语料越多,语言能力就越强。

在文本-视频检索任务中,VL-JEPA同样表现出色。在MSR-VTT、ActivityNet、DiDeMo、YouCook2等八个基准测试中,该模型都取得了竞争力的结果,证明了Action100M不仅能帮助理解动作,还能建立视频内容与文字描述之间的精确对应关系。

五、技术创新:解决长尾分布的智能采样

Action100M面临的一个重要挑战是动作频率的长尾分布问题。这就像现实生活中,"说话"这个动作出现的频率远高于"修理发动机"一样,数据集中某些常见动作的实例数量远超其他动作。如果不加处理,模型可能会过度偏向这些高频动作,而忽略那些同样重要但较为少见的动作。

为了解决这个问题,研究团队开发了一种语义重采样策略。首先,他们使用EmbeddingGemma-300M模型将所有动作描述转换为数值向量,然后通过文本哈希去除重复描述,接着使用k-means聚类算法将相似的动作归为一组。这个过程就像整理一个巨大的动作图书馆,把相似的动作书籍放在同一个书架上。

通过控制聚类数量(k值分别设为1000、10000、100000),研究人员可以调节动作空间的粒度。较小的k值会产生更宽泛的动作类别,而较大的k值则会形成更精细的分类。实验表明,使用语义重采样策略确实能够提升模型性能,特别是当使用较小聚类数量时效果更为明显。

这种方法的巧妙之处在于,它既保证了高频动作有足够的训练样本,也确保了低频动作不被忽视。就像一位优秀的教师会根据学生的掌握情况调整教学内容的分配比例,多练习薄弱环节,巩固已掌握的知识点。

六、深度分析:数据质量的多维度考量

Action100M的价值不仅体现在规模上,更在于其数据质量的精心设计。研究团队对数据集进行了全面的统计分析,就像给一个巨大的图书馆做详细的馆藏清单一样。

从词汇分布来看,简短动作描述平均长度为3.2个词,简短视频标题为19.2个词,详细动作描述为27.8个词,详细视频标题则达到95.3个词。这种层次化的描述长度设计确保了不同应用场景的需求都能得到满足。

动作类型的分析揭示了有趣的模式。最高频的动作往往与教学视频的特性相关,比如"speak to camera"(对着镜头说话)出现了213万次,反映了教学视频中讲解环节的重要性。同时,实际操作动作如"stir"(搅拌)、"add"(添加)、"mix"(混合)等也占据重要位置,体现了教学内容的实用性。

通过对重复内容的分析,研究团队发现了758万个重复组合,包含1.418亿个重复实例。这一发现不仅展示了大规模数据中不可避免的冗余问题,也为语义重采样策略的必要性提供了有力支撑。

七、对比分析:站在巨人的肩膀上

Action100M的价值在与现有数据集的对比中更加突出。传统的动作识别数据集,如COIN包含4.63万个动作实例,YouCook2包含1.4万个实例,即使是较大的Assembly101也只有100万个实例。相比之下,Action100M的1.47亿实例规模是前者的数百倍。

更重要的是覆盖范围的差异。传统数据集往往专注于特定领域,比如COIN主要关注日常任务,YouCook2专注于烹饪,EgoProceL聚焦于第一人称视角的程序性任务。而Action100M则涵盖了更广泛的人类活动,从烹饪、手工制作到家居装修、园艺养护等各个方面。

在标注质量上,Action100M也显示出独特优势。传统数据集大多依赖人工标注,虽然准确性较高但成本昂贵且规模受限。Action100M采用的自动化标注流程虽然可能在某些细节上不如人工标注精确,但其规模优势和一致性却是人工标注难以企及的。

八、技术细节:构建智能标注系统

Action100M的技术实现体现了当前AI技术的最高水准。整个处理流程就像一条高度自动化的生产线,每个环节都经过精心设计和优化。

在视频分割阶段,系统使用V-JEPA 2 ViT-g-384编码器提取视觉特征,采用四帧一采样的策略来近似V-JEPA 2预训练时的时间分辨率。64帧重叠窗口以8帧步长滑动,确保时间连续性的同时提供足够的上下文信息。分层聚类使用Ward链接方法,通过最小化组内方差来确定最优分割点。

在标题生成阶段,系统巧妙地结合了静态和动态信息。对于叶子节点(最小动作片段),使用Llama-3.2-Vision-11B处理关键帧的中点图像;对于更高层节点,使用Perception-LM-3B处理32帧均匀采样的视频序列。这种分工协作的方式充分发挥了不同模型的专长。

LLM聚合阶段是整个流程的核心,GPT-OSS-120B在这里扮演着类似于资深编辑的角色。它不仅要整合来自不同层次的标题信息,还要结合全局上下文如视频标题、描述和ASR转录文本,最终生成结构化的动作标注。三轮自我完善机制确保了输出质量的稳定性和可靠性。

九、应用前景:从实验室走向现实世界

Action100M的意义远远超出了学术研究的范畴。在智能家居领域,配备了基于Action100M训练的模型的摄像头和传感器可以更准确地理解用户的日常活动,提供个性化的智能服务。比如,当系统识别到用户正在准备早餐时,可以自动调节厨房照明、播放合适的音乐或者提醒今天的天气信息。

在教育培训方面,Action100M为开发智能教学系统提供了可能。系统可以分析学员的操作视频,识别不规范的动作或遗漏的步骤,提供针对性的指导建议。无论是医疗培训中的手术技巧学习,还是职业教育中的技能培训,都可以从中受益。

对于内容创作者来说,基于Action100M的技术可以实现更智能的视频编辑和内容推荐。系统可以自动识别视频中的关键动作片段,生成精确的时间戳和标签,大大提升视频制作和检索的效率。

在辅助技术领域,Action100M为开发视障人士辅助设备提供了新的可能性。通过实时分析环境中的人类活动,设备可以为用户提供详细的语音描述,帮助他们更好地理解周围发生的事情。

十、挑战与限制:不完美但持续进步

尽管Action100M取得了显著成就,但研究团队也坦诚地指出了现有的限制。自动化标注流程虽然具有规模优势,但在某些细节识别上可能不如专业人工标注准确。特别是对于一些微妙的动作差异或文化特定的行为模式,系统可能存在理解偏差。

数据集的来源主要是英语教学视频,这在一定程度上限制了其文化多样性。不同文化背景下的行为模式和动作习惯可能存在差异,这些差异在当前数据集中可能得不到充分体现。

此外,教学视频的特殊性质也带来了一定的偏向性。相比于真实生活中的自然行为,教学视频中的动作往往更加标准化和清晰化,这可能会影响模型在处理日常生活场景时的泛化能力。

技术实现层面,大规模数据处理的计算成本仍然是一个挑战。虽然研究团队已经通过巧妙的设计优化了处理流程,但130万V100 GPU小时的总计算量仍然是一个不小的数字,这可能限制了类似研究的普及。

说到底,Action100M代表了人工智能理解人类行为这一领域的重要突破。通过创新的数据收集和处理方法,研究团队构建了迄今为止最大规模、最全面的视频动作数据集,为AI真正理解和预测人类行为奠定了坚实基础。

这项工作的价值不仅在于数据集本身,更在于它展示的技术路径和方法论。自动化的大规模数据处理流程、多层次的动作理解框架、语义重采样等创新技术,都为后续研究提供了宝贵的参考。

当然,从数据集到实用系统还有很长的路要走。如何在保持规模优势的同时提升标注质量,如何增强数据的文化多样性,如何降低计算成本让更多研究者能够参与,这些都是需要继续探索的问题。但正如研究团队在论文中所说,Action100M为可扩展的视频理解研究奠定了新的基础,这个基础足够坚实,也足够宽广,支撑着我们向着真正智能的未来迈进。

有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2601.10592v1查询完整论文,或访问项目主页https://github.com/facebookresearch/Action100M获取更多信息。

Q&A

Q1:Action100M数据集有什么特别之处?

A:Action100M是目前最大规模的视频动作数据集,包含1.47亿个动作片段,相当于14.6年的视频内容。它不仅规模庞大,还采用了创新的分层标注方法,为每个动作提供从简短描述到详细解析的多层次标注,涵盖了从基本手部动作到复杂任务流程的各个层面。

Q2:普通人能直接使用Action100M吗?

A:Action100M主要是为AI研究提供的训练数据集,普通用户不能直接使用。但基于这个数据集训练的AI模型将会应用到智能家居、视频编辑、教育培训等各个领域,最终会以各种智能产品和服务的形式惠及普通用户的日常生活。

Q3:Action100M如何保证标注质量?

A:研究团队开发了完全自动化的处理流水线,使用多个先进AI模型协作完成标注工作。系统采用Tree-of-Captions方法从多个角度分析动作,并通过GPT-OSS-120B进行三轮自我完善处理,不断核对和修正描述内容,确保最终标注既准确又详细。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-