微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 伊利诺伊大学厄巴纳-香槟分校的突破:AI终于学会了"听懂弦外之音"——CogniRoute如何让机器真正理解社交视频

伊利诺伊大学厄巴纳-香槟分校的突破:AI终于学会了"听懂弦外之音"——CogniRoute如何让机器真正理解社交视频

2026-07-02 12:34
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-02 12:34 科技行者

这项由伊利诺伊大学厄巴纳-香槟分校联合哥伦比亚大学和谷歌共同完成的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2606.20970,有兴趣深入了解的读者可通过该编号查阅完整原文。

人和人之间的交流,从来都不只是嘴巴说了什么。当你的朋友用一种特别平淡的语气说"哦,真棒啊",你立刻就能听出那是讽刺。当一个人说话时眼神飘忽、嘴角带着不自然的微笑,你知道他在撒谎或者掩饰什么。这种从表情、声音、肢体动作和语言内容中综合读取真实含义的能力,是人类社交智能的核心。然而,对于当今最先进的人工智能系统来说,这件事依然非常困难。

研究团队将这个问题称为"有多模态输入,不代表用对了多模态"。换句话说,一个AI系统虽然能同时接收视频、音频和文字,但它不一定知道在什么情况下应该重点听声音、什么情况下应该重点看脸、什么情况下声音和画面是互相矛盾的。正是为了解决这个问题,研究团队提出了一个叫做CogniRoute的系统,并配套建立了一个叫做OmniSocialBench的测试基准。最终结果表明,CogniRoute在社交视频理解任务上比最强的开源同类系统高出了将近27个百分点,甚至超越了谷歌旗下Gemini这类顶级商业系统超过15个百分点。

---

一、当AI"看"不懂人心:问题出在哪里

为了理解这项研究到底在解决什么难题,不妨先想象一个场景。你正在观看一段视频,画面里一个人嘴上说"没事,我很好",但声音里带着哽咽,眼眶微微泛红,手指在桌上不停地敲击。如果有人问你"这个人现在心情怎么样",你肯定不会相信他嘴上说的"没事",而会综合所有信号判断他其实很难过。

现有的AI系统在面对这类问题时,表现出一个让研究者头疼已久的毛病。这些系统虽然拥有同时处理视频、音频和文字的能力,但它们并不知道哪个信号在这道特定的题目里才是关键线索。有时候它们给出了正确答案,但那只是碰巧猜对了,背后的推理过程其实用错了证据。就像一个考试作弊的学生,虽然答案写对了,但根本没有真正理解题意。

更麻烦的是,现有的测试数据集通常只告诉AI"正确答案是什么",却不告诉它"为什么是这个答案""应该重点看哪段视频""声音和画面之间的关系是什么"。这就好比只给厨师一份菜谱的最终成品照片,却不告诉他食材的比例、烹饪的顺序和每个步骤的火候。厨师可能做出一道卖相相似的菜,但里面的味道和营养成分可能完全不对。

研究团队还特别指出,这个问题在社交场景中尤为突出。社交互动中充满了模糊性和歧义——一个手势、一个眼神、一个停顿都可能改变整段对话的含义。在这类场景里,AI如果只是靠"猜"而不是靠真正理解证据来回答问题,危害是非常大的。

---

二、破案需要"专家分工":MoE架构是什么

在深入了解CogniRoute的设计之前,需要先理解一个叫做"混合专家"(Mixture of Experts,MoE)的架构。这是AI系统内部的一种组织方式,非常类似于一个大型侦探机构的运作模式。

一个大型侦探机构里有很多不同专长的侦探。有擅长分析现场视觉证据的,有专门解读当事人声音和说话方式的,有精通社会关系网络的,也有专门研究时间线和事件先后顺序的。当一个案件进来,机构不会让所有侦探同时上阵处理每一个细节,而是根据案件类型,把合适的侦探派到合适的岗位上。

AI系统里的"专家"就是处理信息的不同模块。在处理每一个输入时,系统会从众多专家模块中挑选一部分来处理当前的信息,而不是让所有模块都同时工作,这样既节省计算资源,又能让合适的模块处理合适的信息。

问题在于,在现有的MoE系统中,这个"派活"的路由器(Router)是怎么决定派哪些专家的呢?答案令人有些失望:它主要依赖于每个输入词的局部特征,并通过预测下一个词的训练目标来间接优化。这就相当于侦探机构的调度员只看每个字的表面意思来分配侦探,而不考虑案件的整体性质——是需要视觉鉴定的案件,还是需要语音分析的案件,还是需要梳理人际关系的案件。调度员从未接受过"根据案件类型分配专家"的专项训练,完全靠本能和运气。

CogniRoute的核心创新,就是给这个路由器装上了一套"案件分类手册",让它学会根据每道题的证据类型、推理需求和时间范围来决定派哪些专家出马。

---

三、案件档案:认知图式是什么,怎么用

研究团队给每一个训练样本都编制了一份"案件档案",他们把这个档案叫做"认知图式"(Cognitive Schema)。这份档案从三个维度来描述每道问题的证据结构。

第一个维度叫做"证据来源"。这个维度回答的问题是:要回答这道题,主要应该依赖视觉信息、音频信息,还是两者兼需?更特殊的情况是,画面和声音是不是相互矛盾的,答案需要从这个矛盾中推断出来?具体来说,这个维度有四种可能的标签。"视觉"表示主要证据来自面部表情、肢体动作、场景布置等画面信息;"音频"表示主要证据来自说话内容、音调、笑声、沉默等声音信息;"联合"表示两种模态都很重要,缺一不可;"冲突"表示视觉和听觉传递了相反的信号,答案需要理解并解决这个矛盾,比如前面提到的那个说"没事"却哭着的人。

第二个维度叫做"推理需求"。这个维度描述的是回答这道题需要什么类型的思考过程。它有六种标签。"直接感知"是最简单的,直接从可见或可听的线索中得出答案;"时序推理"需要理解事件发生的先后顺序和时间关系;"因果推理"需要找出什么导致了什么;"心理状态推理"需要推断一个人隐藏的情绪、意图或信念;"社会规范推理"需要理解社会习俗、角色期待和场合的适当性;"反讽推理"需要识别字面意思和真实意图之间的落差。

第三个维度叫做"时间范围"。这个维度说明的是回答问题需要看视频的哪个范围。"瞬时"表示只需关注某个短暂的时刻;"局部窗口"表示需要看关键事件前后的一小段连续片段;"长程"表示证据分散在整段视频的大部分时间里;"多片段"表示需要把视频中几个分散的不连续片段联系起来分析。

这三个维度的标签组合在一起,就构成了一道题的完整认知图式。例如,一道关于"某人拒绝请求时表现如何"的题,其认知图式可能是:证据来源=冲突(嘴上答应但肢体语言显示排斥),推理需求=心理状态推理(需要推断其真实态度),时间范围=局部窗口(只需关注对话发生的那段时间)。

有一点特别重要:这份"案件档案"只在训练阶段使用,帮助AI学习如何根据问题类型分配专家资源。一旦训练完成,正式使用CogniRoute解答问题时,它根本看不到这份档案,只能凭借自己在训练中学到的"直觉"来做路由决策。这意味着CogniRoute真正内化了"不同类型的问题需要不同证据"这个道理,而不是依赖外部标签。

---

四、训练路由器的第一堂课:让路由行为对齐证据结构

有了认知图式,下一步就是用它来训练路由器。研究团队设计了一个叫做"图式对齐预测路由"(Schema-Aligned Predictive Routing,SAPR)的训练目标。

通俗地说,这个训练目标的逻辑是这样的:同一道问题,每一层专家模块在处理视频、音频、问题文本时,都会给128个专家分配不同的激活概率。研究团队把这些概率按照视频、音频、文本三种模态分别取平均,再把各层的结果整合成一个向量,这个向量就是该问题的"全局路由签名"——可以理解为这道题在AI内部处理时留下的"证据分配指纹"。

与此同时,那份认知图式也被转化成一个目标向量,表示"对于这种类型的问题,应该有什么样的证据分配指纹"。SAPR训练目标的核心,就是让AI产生的实际路由签名,在方向上尽可能接近认知图式规定的目标向量。

打一个更直观的比方:假设侦探机构里有128个侦探,每次处理案件时只能派其中8个。认知图式规定:对于"嫌疑人真实情绪"类型的案件,应该多派擅长表情分析和声纹分析的侦探,少派研究案发现场物证的侦探。SAPR训练的过程,就是反复告诉调度员:"你刚才的派遣方式和应该的方式差了多少",让调度员慢慢学会"看案件类型派人"。

在整个监督微调阶段,AI的训练目标是SAPR损失、语言模型生成损失(让AI生成好的推理过程和正确答案)和负载均衡损失(确保128个专家都被均衡使用,不会有专家闲置或过度使用)三者的加权组合。

研究团队还通过实验验证了SAPR的有效性。通过对比SAPR使用前后的路由签名可视化图(降维到二维平面展示),可以清楚地看到:没有SAPR时,不同类型问题的路由签名混在一起,毫无规律;加入SAPR后,相同证据类型的问题聚成了清晰的簇,不同推理需求的问题也形成了分离的区域。这说明路由器确实学会了根据问题的证据结构来分配专家资源。

---

五、训练路由器的第二堂课:用结果奖惩来强化"正确的决策过程"

仅仅让路由器学会"按类型派人"还不够,因为AI系统最终的目标是给出正确答案,而通往正确答案的路径可能有很多条,其中不少是"歪门邪道"——比如靠语言惯性猜答案,而不是真正分析视频内容。

为了解决这个问题,研究团队在监督微调之后又加入了一个强化学习阶段,叫做"路由感知MoE强化学习"(Route-Aware MoE Reinforcement Learning,RMRL)。这个阶段的核心理念,可以用一句话概括:奖励不仅要看"答对了没有",还要看"用没用正确的证据,有没有看对时间段"。

具体来说,每次AI给出回答后,会收到三种奖励信号的组合。第一种是答案正确性奖励,非常直接:答对得1分,答错得0分。第二种是模态一致推理奖励,由一个冻结的大语言模型(Gemini-3.1-Pro)担任"评委",检查AI的推理过程有没有正确地使用应该用的那种模态证据——比如,一道需要综合音视频的题,AI是否在推理文字里提到了具体的视觉观察和具体的声音特征,而不是只说"根据视频内容"这种空话。这个评委用五档打分:1.0、0.75、0.5、0.25、0.0,并且严格要求具体的观察描述,不接受空泛的表述。第三种是认知时序基础奖励,将在下一章节详细介绍。

强化学习阶段有一个特别的设计:奖励不仅影响AI生成哪些词,还会反向传播到AI内部的路由决策上。具体实现方式是:AI先生成一批不同的回答,对每个回答计算综合奖励,再把这个奖励作为"优质程度的信号",同时更新两件事——哪些词的生成概率应该提高或降低,以及生成这些词时路由器选择哪些专家的概率应该提高或降低。一次高奖励的回答,不只是让AI学会"以后也说这样的话",还让AI学会"以后遇到这种题,就用这批专家来处理"。

这就像是培训一个侦探团队:不只是根据最终破案结果给侦探打分,还要分析整个破案过程中每个阶段的决策——在哪个阶段应该让哪位专家上,在哪个阶段浪费了人力。通过不断复盘,整个团队的协作效率越来越高。

---

六、AI看视频需要"找准时间段":认知时序基础奖励

一道关于"某人在第5分钟表情如何"的问题,如果AI的回答靠的是第1分钟的画面,即使答案碰巧正确,这个推理过程也是有问题的。研究团队专门设计了一种奖励机制来解决这个问题,让AI学会"在正确的时间段找证据"。

这个机制的基本思路是利用AI自身的注意力机制来检测它"在看哪里"。在深度学习模型中,注意力机制决定了处理某个输出时,模型把多大的"关注程度"分配给了输入的哪些部分。研究团队选取AI生成推理过程最后几个词(推理结论的时候)的注意力,统计它对视频和音频中各个时间段的关注程度,从而得出一个"时间焦点分布"——AI在最终做结论时,它的"注意力"分布在视频的哪些时间段上。

然后,把这个"时间焦点分布"和标注的"证据所在时间段"进行比较。标注的时间段被转化成一个"目标分布",其中证据区间内的时间点概率高,越远离证据区间的时间点概率越低(通过高斯核函数平滑处理,避免要求AI精确到某个毫秒级的时刻,允许一定的容忍范围)。最终奖励值取决于AI的时间焦点分布和目标分布之间的差距——差距越小,奖励越高;差距越大,奖励越低。

这个奖励的巧妙之处在于它不依赖任何额外的时序定位模型,只是借用了AI自身的注意力信息作为代理信号。这就好像不需要为侦探单独配一个"时间管理顾问",只需要追踪侦探翻阅案件档案时的视线落点,就能判断他有没有把注意力集中在关键的时间证据上。

通过一系列消融实验,研究团队证明了这个奖励确实有效。相比不使用时序基础奖励的模型,加入该奖励后,AI的推理结论与标注证据时间点的平均距离(PeakErr)从2.67秒降到了1.56秒,在0.5秒和1.0秒容忍窗口内的准确率也大幅提升。而且研究团队还做了一个"打乱时间标签"的对照实验,证明这个提升确实来自正确的时序信号,而不是因为增加了额外的训练信号本身。

---

七、为AI打造专属"社交场景题库":OmniSocialBench

再好的训练方法也需要合适的数据。研究团队发现,现有的视频问答数据集根本无法支撑这种训练方式,因为它们只提供了"问题+答案",完全没有提供"这道题需要用哪种模态证据"、"证据在视频的哪个时间段"、"这道题需要什么类型的推理"等信息。

为此,研究团队专门构建了OmniSocialBench,一个包含11.8万条结构化训练样本和一批经过人工核验的评测样本的社交视频问答数据集。数据来源涵盖多人互动视频、情感和语用推理视频、第一人称视角视频以及一般性社交视频,保证了场景的多样性。

数据集的构建采用了一个分阶段的流程,类似于一个严谨的案件记录系统。第一阶段叫做"结构化证据提取":让AI(使用Gemini-3.1-Pro)纯粹作为观察员,只记录视频中可以直接观察到的事实,用JSON格式输出,包含场景描述、参与者信息、带时间戳的视觉事件、带时间戳的音频事件、对话结构、跨模态关系以及质量标志(比如画面太暗、说话者不在画面里等)。这个阶段明确禁止AI推断任何社会性解释,只记录"发生了什么",不记录"意味着什么"。第二阶段是"任务标注":基于第一阶段提取的证据JSON,为每个样本分配三个维度的认知图式标签,也就是证据来源、推理需求和时间范围。第三阶段是"推理生成":基于证据JSON和三个标签,让AI生成"<推理过程>...</推理过程><答案>...</答案>"格式的完整回答,并且严格要求推理过程只能使用证据JSON中已经记录的信息,不能凭空添加。生成的答案必须和原始标注答案一致,否则该样本被丢弃。

评测集还额外加入了一个"社交维度"标签,把评测样本分为四类:心理状态推理(隐藏情绪、信念、意图等)、语用含义推理(讽刺、礼貌、暗示等)、行动目标推理(行为背后的目的和计划)、社会规范推理(角色期待、场合规则、适当性判断)。所有评测样本都经过人工逐一核验,确保问题、证据、推理和答案之间的一致性。

整个数据集里,训练集的1万条样本用于训练路由相关的轻量级预测模块,9万条用于监督微调阶段,另外1万条用于强化学习阶段。评测集包含800条样本,均匀分布在四个社交维度上。

---

八、这套系统到底有多厉害:实验结果

用一个简单的数字来概括这项研究的成果:CogniRoute在OmniSocialBench评测集上取得了59.38%的平均准确率,而同类最强商业系统Gemini 3.1 Pro的成绩是44.05%,最强开源同类系统Qwen3 Omni的成绩是32.61%。换句话说,CogniRoute比当前最好的商业系统高出了超过15个百分点,比最强开源系统高出了将近27个百分点。

具体到四个社交维度,CogniRoute在每个类别上都是第一名。在社会规范推理上,CogniRoute得到了58.13%,而Gemini 3.1 Pro只有33.33%,提升幅度达到了24.8个百分点,几乎是提升了三分之二。在行动目标推理上,CogniRoute得到66.44%,而最强基线(Gemini 3.1 Flash)是47.65%,提升了18.79个百分点。这两类问题恰恰是最需要联合视觉和音频证据、解决跨模态矛盾、并进行时序定位的场景,也正是CogniRoute设计的核心发力点。

研究团队还把CogniRoute放在10个现有公开评测基准上和它的基础模型Qwen3-Omni-30B进行了比较。结果显示,在10个基准中有8个出现了提升。在联合音视频推理类的基准(如AV-SpeakerBench、OmniBench、Daily-Omni等)上,CogniRoute普遍略有提升;在纯视频理解类基准上也有一定提升;只在纯音频推理基准(MMAU)上出现了微小的下降(75.4%降至73.2%),研究团队认为这是因为部分专家容量被重新分配给了音视频联合协调任务,属于合理的权衡。

这说明CogniRoute的改进不只是对特定训练数据的"死记硬背",其证据感知路由能力有一定的迁移性,能够在更广泛的多模态理解任务中带来收益。

---

九、一项一项拆开验证:消融实验说明了什么

为了确认每个设计选择真的有用,研究团队进行了大量的消融实验,也就是逐一拿掉某个组件,看性能下降了多少,从而反推每个组件的贡献。

关于SAPR的必要性,基础监督微调(没有SAPR)的平均准确率是40.13%,加入SAPR后提升到了50.13%,提升了整整10个百分点。但如果用打乱的图式标签(每个样本配上另一个样本的标签)来代替正确标签,准确率只有41.38%,几乎没有提升;用随机标签的准确率是40.63%,同样基本没有提升。这强有力地证明了:SAPR的提升不是来自于"有辅助损失"这件事本身,而是来自于"用正确的、和该样本真正对应的证据结构标签"来指导路由器。

关于路由签名设计的细节,如果把各层专家路由器的统计量用同一个投影矩阵映射(而不是每层单独一个投影矩阵),准确率会从50.13%下降到44.50%。这说明不同层的专家语义不同,必须保留层级信息。研究团队还检查了"可学习标签嵌入矩阵"是否会坍缩(也就是不同标签的向量变得几乎相同),结果显示Full SAPR的标签嵌入矩阵有较高的归一化有效秩(0.92)和较低的平均余弦相似度(0.06),说明不同标签确实映射到了空间中不同的方向,没有坍缩。

关于RMRL中门控分支(gate branch)的必要性,只使用词语生成分支的RL平均准确率是56.13%;允许路由器参数更新但不使用路由概率比率的变体是56.75%;只使用门控分支的变体是51.88%;两者都用的Full RMRL是59.38%。这组数据说明:词语分支和门控分支各有贡献,而"路由概率比率"这个机制本身是必要的,仅仅让路由器变为可训练还不够,必须明确地用奖励信号来更新专家选择的概率。

研究团队还测试了强化学习时探索"候选专家池"大小的影响。模型有128个专家,每次选8个。如果只从最高分的8个中选,是确定性路由。研究发现,允许从排名前12的候选专家中选8个时效果最好(59.38%),更大的候选池(15或16)反而降低了性能,说明过多的探索会引入低质量的路由选择。

---

十、从实验室到现实世界:VR眼镜部署案例

研究团队还把CogniRoute部署到了VR智能眼镜上,进行真实场景的测试。两个典型案例展示了CogniRoute在实际应用中的能力。

第一个案例是"手势目标推断"。戴着眼镜的用户看到一个人一边说"能把那个递给我吗"一边用手示意。CogniRoute同时结合了手部轨迹(视觉信号)和语音内容(音频信号),正确推断出这个人想要的是右前方的咖啡罐,而不是左边的其他物品。

第二个案例是"礼貌性拒绝识别"。有人请求帮忙整理桌面,对方回应"好吧,当然",但语气迟疑,肢体语言显示出些许回避。CogniRoute捕捉到了这个声音和动作之间的微妙矛盾,正确识别出这是一个礼貌性的拒绝,而不是真正愿意帮忙的回应。

这两个案例体现了CogniRoute的两种核心能力:一种是把视觉和音频信号协同使用("协同路由"),另一种是识别信号之间的冲突并从中提取真实含义("冲突解析路由")。这对于未来的社交辅助AI、无障碍技术以及人机交互系统都有直接的应用价值。

---

研究的边界与未来方向

研究团队在论文中坦诚地指出了这项工作的局限性。目前CogniRoute只针对预先剪辑好的视频片段和文字形式的回答,还不能处理实时流媒体或语音生成任务。认知图式使用的标签空间设计得比较精简,是为了路由监督而优化的,对于某些特定领域的应用可能需要更细粒度的扩展。此外,目前的实现基于MoE架构的全模态模型,如果要移植到其他架构可能需要一定的工程适配。

在数据方面,虽然OmniSocialBench的训练标注是用Gemini生成的,但评测集的最终标签全部经过人工核验,并且明确声明"Gemini的输出不作为评测集的正确性标准或入选标准",以避免用AI评估自己的后代系统所带来的循环偏差。研究团队还强调,这个系统用于社交视频分析时必须配合隐私保护措施和跨文化偏见审查,不能用于对真人进行高风险的判断。

归根结底,这项研究揭示了一个简单但重要的道理:AI理解社交场景的关键不只是"拥有多种感知能力",更在于"知道什么时候该用哪种感知"。这种元层面的"证据意识",是从真正理解社交智能的角度出发,对AI系统训练方式的一次有意义的重新思考。对于未来希望真正读懂人类情感和意图的AI系统而言,CogniRoute提供的路由范式或许是值得深入探索的一个方向。感兴趣的读者可通过论文编号arXiv:2606.20970获取完整的技术细节。

---

Q&A

Q1:CogniRoute和普通多模态AI有什么核心区别?

A:普通多模态AI虽然能同时接收视频、音频和文字,但不知道在每道题里该重点依赖哪种信号。CogniRoute的核心区别是训练了一套"证据分配机制",通过认知图式标签(证据来源、推理类型、时间范围)来指导内部专家路由器,让正确的专家模块处理正确类型的问题,从而实现更准确的社交场景理解。

Q2:OmniSocialBench数据集和其他视频问答数据集有什么不同?

A:大多数视频问答数据集只提供"问题+正确答案",不说明答案依据哪种模态证据、在视频哪个时间段,以及需要什么类型的推理。OmniSocialBench为每个样本额外标注了证据来源类型(视觉/音频/联合/冲突)、推理需求类型(六种)、时间范围类型(四种)、带时间戳的结构化证据、有根据的推理过程,以及评测集的社交维度标签,支持比答案准确率更细粒度的诊断性评估。

Q3:认知时序基础奖励是怎么判断AI"看对了时间段"的?

A:研究团队利用AI自身的注意力权重作为代理信号。当AI生成推理结论的最后几个词时,它对输入视频各时间段的注意力分布反映了它"在看哪段视频"。将这个注意力分布与标注的证据时间段(通过高斯核函数转化为平滑目标分布)进行比较,两者越接近奖励越高。这个机制完全依赖模型内部信息,不需要额外的时序定位模型。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-