微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 卡塔尔计算研究所发布"认知考卷":这份专为AI设计的双语试卷,正在揭露视觉语言大模型的真实认知短板

卡塔尔计算研究所发布"认知考卷":这份专为AI设计的双语试卷,正在揭露视觉语言大模型的真实认知短板

2026-06-15 11:35
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-15 11:35 科技行者

这项由卡塔尔计算研究所(Qatar Computing Research Institute, QCRI)及哈马德·本·哈利法大学(Hamad Bin Khalifa University)联合不列颠哥伦比亚大学(University of British Columbia)与Zuse School ELIZA共同完成的研究,以预印本形式发布于2026年6月,编号为arXiv:2606.05531v1。感兴趣的读者可通过该编号在arXiv平台查阅完整论文。

当你把一张照片交给现在最先进的AI,问它"这幅画想表达什么情感?",它往往能侃侃而谈;但如果你问它"这面旗帜属于哪个国家?",它却可能答非所问。这种反差背后隐藏着一个让AI研究者头疼已久的问题:我们究竟在多大程度上真正了解这些AI系统的认知能力?

长期以来,研究者习惯用一份份专项测试来衡量AI的能力——这道题考数学,那道题考识图。就好像一个老师每次只出单科考题,从来不出综合卷,自然就无法判断学生是否真正融会贯通。这项来自卡塔尔计算研究所的研究正是要填上这个空缺,他们设计了一套名为"BloomBench"的综合认知测评系统,并将其作为更大评测项目"Almieyar"的重要组成部分公开发布。

一、为什么AI需要一张"认知考卷",而不只是一堆题目

回到那位学生的比喻。如果老师只考"背单词"和"做数学题",却从不考"读完这篇文章之后写出你的感想",那即便学生得了高分,我们对他真正的思维能力仍然一无所知。现实中,我们对AI的评测恰好就陷入了这个困境。

当前最主流的AI视觉语言模型(Vision-Language Models,简称VLMs——就是那种既能"看图"又能"说话"的AI)评测,大多围绕具体任务展开:能不能回答关于图片的问题、能不能给图片写说明、能不能识别图中的物体。这些测试虽然有用,却像是散落一地的拼图碎片,拼不出一幅完整的认知画像。高分通过某项测试,并不代表AI真的具备深层次理解能力——它可能只是掌握了那类题目的答题套路,就像有些学生擅长应试却不擅长解决真实问题。

要想真正了解AI的认知全貌,研究团队决定借用一套在教育界已经使用了几十年的框架——布鲁姆分类法(Bloom's Taxonomy)。这个由美国教育学家本杰明·布鲁姆提出、后经安德森和克拉斯沃尔修订的框架,把人类的认知活动从低到高分为六个层次:记忆、理解、应用、分析、评价、创造。这就好比把人的思维能力分成六层楼:地下室是最基础的记忆能力,顶层是最复杂的创造能力,中间几层分别对应着理解、应用、分析和评价。

按照这个框架,研究团队构建了BloomBench——一套横跨六个认知层次、涵盖106种具体任务类型、共7747道双语(英语和阿拉伯语)题目的大型测评基准。每一道题都配有一张真实图片、一个问题和四个选项,并且同时提供英语和阿拉伯语两个版本。这在视觉语言模型的评测历史上尚属首次。

二、这套"认知考卷"是怎么出题的

出这套题的过程,颇有一种"用AI来考AI"的意味,但背后有严谨的质量控制机制。

整个题目生成流程分为几个环节,环环相扣。首先是"选题方向"阶段。团队根据布鲁姆分类法的六个层次和106个具体任务类型,为每个任务设计了包含文化背景的场景方案。他们使用了谷歌高性能推理模型Gemini 2.5 Pro来生成每个任务的十个场景关键词,这些关键词覆盖了西方文化、中东北非(MENA)地区以及阿拉伯文化语境,目的是让题目不偏向某一种文化背景。这些关键词随后被用于从互联网上搜索真实图片——不是合成图,而是日常生活中实际存在的照片。

拿到图片后,进入"出题"阶段。同一个AI模型被提供图片、场景上下文和目标认知层次的详细描述,生成初始的开放式问答对。这一步的核心要求是:问题必须完全依赖图片内容才能回答,不能靠文字常识就能猜出答案。换句话说,出的是真正的"看图说话"题,而非把图片当装饰的"文字题"。

接下来,开放式问题被改造成四选一的单选题格式。除正确答案外,还设计了三个"诱惑性错误选项",其中有一个专门精心设计的"陷阱选项"——它看起来很像正确答案,但其实错了,专门考验模型的深层理解而非浅层匹配。例如,在一道考察阿拉伯服饰识别的题目中,陷阱选项可能把卡塔尔服饰和阿联酋服饰混淆。

全部题目随后被翻译成现代标准阿拉伯语,翻译时特别注意语义和认知层次的一致性——不只是字面翻译,而是确保阿拉伯语版本考察的是完全相同的认知能力。

最后是严格的质量把关阶段。团队采用了"混合质量验证协议":先用AI(Gemini 3 Pro)自动过滤明显有问题的样本,再对969道题(约占总量的八分之一)进行人工审核。这969道题是按照分层抽样方式选出的,确保106个任务类型中每种都至少抽到4道题。人工审核员按照四个维度来判断每道题:图片质量和相关性、问题的清晰度和认知层次对应性、选项设计的合理性、以及阿拉伯语翻译的忠实度。最终,AI标记了15道可疑题目,人工审核确认恰好这15道确实有问题,综合质量达到98.45%。

从题目分布来看,最基础的"记忆"层次题目最多,共2948道;"理解"层次有1592道;"分析"层次有1431道;"创造"层次有685道;"评价"层次有592道;"应用"层次有499道。题目数量的分布在一定程度上反映了不同认知层次的任务丰富度差异。

三、六层认知楼的每一层,究竟在考什么

现在说说这套考卷的具体内容。六层认知楼各有各的考察重点,就好比一栋楼的每一层功能不同。

地下一层是记忆(Remember),也就是最基础的感知识别和事实回忆。这一层考的是"你看到了什么"——识别动物、食物、场景、交通标志、国旗、品牌LOGO、表情符号、公式符号、手写文字等等。这层楼里的住客是各种"认出来"的能力,是所有高阶认知的根基。

一楼是理解(Understand),考察的是"你明白了什么"——不只是认出图里有什么,还要理解多个物体之间的关系和组合意义。比如识别一张图中同时存在的多种物品的属性(颜色、大小、质地、艺术风格),或者理解图片传达的情绪、语言表达方式、视觉隐喻等更抽象的含义。

二楼是应用(Apply),考察的是"你能用知识做什么"——将学过的设计原则、数学公式、科学概念运用到新的视觉情境中,或者理解否定句、词序变化、连词在视觉多模态语境下的含义。这层楼开始需要调动外部知识,而不只是盯着图片看。

三楼是分析(Analyze),考察的是"你能看穿表象到本质吗"——找出图片中不寻常的属性(比如颜色异常、尺寸反常的物体)、根据上下文推断隐含信息、解析图表和表格数据、进行逻辑推理和科学推断。这层楼开始需要把图片"拆解",而不只是整体感知。

四楼是评价(Evaluate),考察的是"你能做出有根据的判断吗"——识别图片中的逻辑矛盾或虚假内容、判断图片是否包含有害内容或文化不敏感内容、评估图片的艺术质量或技术质量。这层楼需要AI扮演"裁判"的角色。

顶层是创造(Create),也是最复杂的一层,考察的是"你能综合信息生成新内容吗"——不过为了方便自动评分,这层的题目以"判断性创造"的形式出现:给出几个可能的创作方案(比如诗歌结尾、故事延续、对话内容),让AI判断哪个方案在韵律、叙事连贯性等方面最优秀。这实际上考察的是AI的"创作品味",是生成能力的前提。

四、现有的主流测评,究竟漏掉了什么

在正式讲评测结果之前,研究团队还做了一件很有说服力的事:他们把当前最知名的视觉语言模型综合评测基准MMMU(Massive Multidiscipline Multimodal Understanding)的1080道题,按照BloomBench的认知框架重新分类,看看MMMU到底在考什么。

结果触目惊心。MMMU的1080道题中,有足足66.4%——也就是将近三分之二——集中在"分析"这一层,而这些分析题又几乎全部是数学推理(344道)、表格分析(85道)和图表分析(68道)。换句话说,MMMU其实主要是一份数理分析测验,披着"综合能力评测"的外衣。

与此同时,MMMU在"创造"和"评价"这两个高阶认知层次上几乎没有题目——两层加起来只占总量的约1%。更严重的是,在BloomBench的106个具体任务类型中,有整整45个在MMMU里完全没有出现,包括歧义消解、毒性检测、对话生成等在真实应用场景中极为重要的任务类型。这就好比一所学校的期末考试只有高等数学和物理,完全没有语文、历史、音乐和体育——学生哪怕考了满分,你对他的全面素质仍然一无所知。

五、把八款主流AI放上考场,结果出乎意料

研究团队选了八款有代表性的视觉语言模型参加这次测评,涵盖开源和商业两类。开源阵营包括谷歌的Gemma 3(分别有4B、12B和27B三个规模版本)、谷歌新一代的Gemma 4(26B和31B两个版本)、阿里云的Qwen2.5-VL-7B以及更早版本Qwen2-VL-7B;商业阵营则是OpenAI的GPT-4o mini。所有模型均使用零样本提示方式(即不给任何示例),并将生成温度设为0以确保结果确定性。

更有趣的是,研究团队采用了两种截然不同的评分方法,并把两种方法的分数都呈现出来,因为它们揭示的信息完全不同。

第一种叫"正则提取法"(Regex-based Answer Extraction,RAE),就是直接看AI输出的文字中有没有选出"A、B、C、D"中的某个答案——这模拟的是真实使用场景,如果AI答非所问没有给出明确选项,就判为错误。

第二种叫"概率评分法"(Likelihood-based Scoring,LBS),不看AI说了什么,而是直接查看AI内部对每个选项的"置信度分数"——也就是AI内心深处最倾向于哪个答案,并对答案长度进行归一化处理,以确保公平比较。这种方法能绕开AI因为格式问题没有明确输出答案的情况,直接探测其内部的"真实想法"。

总体结果方面,在英语题目的RAE评分下,Gemma 4 31B以89.8%的准确率夺得第一,紧随其后的是Gemma 3 27B(88.3%)和Gemma 4 26B(87.6%)。GPT-4o mini得到82.4%,位于中游。在阿拉伯语版本上,Gemma 4 31B仍然领先(87.6%),整体而言阿拉伯语成绩普遍低于英语成绩。

然而,一旦换用概率评分法(LBS),排名就发生了戏剧性的变化。Qwen2.5-VL-7B在英语RAE下得分86.9%,切换到LBS后降至65.4%,还算稳定。而Gemma 3系列则出现了令人瞠目的"反向规模效应":Gemma 3 27B在RAE下是最强的开源模型(88.3%),但在LBS下得分暴跌至33.6%,是所有模型中LBS最低的!相比之下,较小的Gemma 3 4B在RAE下得79.6%,LBS却有60.9%,反而比27B更"诚实"。

这说明什么?两种评分方式揭示的是两种不同的能力维度。RAE反映的是AI在实际使用中的表现——它能输出正确格式、给出正确答案吗?LBS反映的则是AI内部认知的一致性——它真的相信自己给出的答案吗?Gemma 3大模型的"高RAE低LBS"现象说明,随着模型规模增大和指令调优强度加深,模型确实变得更擅长"说出正确答案",但其内部的概率分布却越来越不精确——就好像一个学生学会了在考试中猜测老师想要的答案,但其实并不真正理解内容。Qwen系列则展现出更高的内部一致性,它的"言行"更加统一。

六、认知六层楼,AI住在哪层最舒适

把结果按照布鲁姆分类法的六层分别展开来看,一幅非常清晰的认知画像浮现出来。

AI在"理解"(Understand)层次上的表现最为亮眼。几乎所有模型在英语RAE评分下,理解层的准确率都超过90%,有的甚至接近100%。在"评价"(Evaluate)层次上,表现也相当出色,大多数模型在英语版本上超过86%。这两层考察的是语义层面的辨别能力——"这幅图中描述的情况有逻辑矛盾吗?""这个艺术作品质量怎么样?"——恰好是当前大模型训练最充分的能力类型。

然而,最基础的"记忆"(Remember)层次,在LBS评分下却异常低迷。比如Gemma 3 27B在记忆层的LBS得分只有0.14,低得惊人。这表明AI对很多具体事实的识别,其实是靠"直觉猜测"而非确定性知识完成的——它可能输出了正确答案,但内心并不真正确信。颜色识别、形状识别、具体物体类别识别,这些对人类来说最基础不过的能力,在AI的内部概率层面却充满了不确定性。

"应用"(Apply)和"创造"(Create)层次的表现也明显弱于中间层次。这两层要求AI把知识迁移到新情境或者对创作进行质量判断,考察的是知识的灵活运用而非记忆和识别。研究团队将这种现象解读为当前AI训练偏好的直接体现:模型被优化来做语义关联和辨别推理,而不是精确的事实记忆或创造性的综合判断。

七、阿拉伯语和英语之间,那道难以跨越的沟

阿拉伯语与英语之间的表现差距,是这项研究的另一个重要发现。整体而言,所有模型在阿拉伯语版本上的准确率都低于英语版本,这在AI领域并不意外——英语训练数据远多于阿拉伯语。

但研究团队做了一件更仔细的事:他们用西班牙语作为"对照实验",来区分"真正的语言理解差距"和"评分方法本身的偏差"。西班牙语也是高资源语言,但与阿拉伯语在文字系统和形态复杂度上有很大差异。在Qwen2.5-VL-7B上的实验结果显示,西班牙语的RAE得分(84.91%)与英语(87.22%)相差只有2.31个百分点,几乎打平;但西班牙语的LBS得分比英语低了8.26个百分点。这证明LBS本身对非英语语言存在系统性惩罚——因为阿拉伯语等形态丰富的语言,同一个词往往需要更多的词元(token)来表示,而LBS公式中的长度归一化处理无法完全消除这种偏差。换句话说,阿拉伯语LBS分数偏低,既有AI确实"不太会阿拉伯语"的真实原因,也有评分工具本身不够公平的技术原因。

从具体认知层次来看,"理解"层次的跨语言稳定性最好——核心语义理解能力在两种语言之间转移得最顺畅。相反,"创造"层次的跨语言差距最大,即便是以多语言能力著称的Gemma 3系列,在从英语切换到阿拉伯语的创造层任务上,也出现了显著的性能下降。这说明高阶的创造性综合能力,是目前跨语言迁移最困难的认知技能。

"应用"层次也出现了有趣的分化:Qwen系列和GPT-4o mini在这一层的跨语言下降幅度明显(Qwen2.5-VL下降约12%),而Gemma 3的12B和27B版本则几乎没有下降。研究团队的解读是,Gemma 3系列在多语言对齐方面的训练投入效果在这里体现了出来,但这种跨语言鲁棒性高度依赖模型规模——同样是Gemma 3,4B版本在所有认知层次上的阿拉伯语下降都比12B和27B版本大得多(应用层下降9% vs 1%)。这暗示了一个可能令人遗憾的现实:让AI在复杂推理任务上跨越语言障碍,可能是一种随规模增大才会涌现的能力,小模型很难拥有。

说到底,这项研究揭示的不只是某几款AI模型的具体得分,而是整个AI视觉理解领域的一个系统性盲区。我们长期以来用"做对了多少道题"来评价AI有多聪明,却没有问"它在哪类思维上强、哪类思维上弱"。BloomBench的价值就在于提供了一把尺子,能够画出每款AI的"认知轮廓图"——不是一条线,而是六个维度的雷达图。

这对普通用户意味着什么?当你依赖某款AI助手回答问题、分析图片或者辅助创作时,你现在可以更清晰地知道:它在理解和评价类任务上可能相当可靠,但在精确的事实记忆和创造性综合方面,它的"信心"可能远没有它的"答案"那么笃定。与此同时,阿拉伯语(以及很多其他非英语语言)的用户,在使用AI视觉理解工具时,仍然面临比英语用户更高的错误率——这是一个尚未被充分解决的包容性问题。

研究团队坦承了这项工作的局限:一是算力和商业API成本的限制,导致部分重要的新型AI系统未能纳入评测;二是BloomBench目前全部采用单选题格式,无法完全捕捉开放式推理任务的能力;三是虽然对近千道题进行了人工审核,全部7747道题并非一一手工核验。不过98.45%的质量率提供了足够的统计置信度。

未来的探索方向令人期待:更多样化的题目格式(填空、简答、多步骤推理)、更具挑战性的高阶认知任务、以及随着更强大的AI生成工具涌现而不断迭代升级的题库——BloomBench从设计之初就考虑到了这种可扩展性。

有兴趣深入了解完整研究方法和数据的读者,可以通过arXiv编号2606.05531查询原论文,研究团队也在GitHub上开放了评测框架和数据集,地址为qcri/Almieyar-Oryx-BloomBench。

---

Q&A

Q1:BloomBench和MMMU这类现有评测基准有什么本质区别?

A:MMMU等现有基准主要集中在"分析"层次的学科知识题目,尤其是数学推理、图表分析等,高达66%的题目集中在这一层,而"创造"和"评价"两层加起来不到总量的1%。BloomBench则按照布鲁姆认知分类法的六个层次均衡覆盖,从最基础的物体识别记忆,到最复杂的创造性判断,共106种任务类型、7747道题,能画出AI完整的认知能力轮廓,而不只是测一个局部维度。

Q2:为什么Gemma 3 27B的RAE得分最高,LBS得分却最低?

A:这两个指标反映的是不同维度的能力。RAE测的是AI输出正确格式答案的能力,LBS测的是AI内部真正相信哪个答案的置信度。Gemma 3 27B经过大量指令调优,学会了"说出"正确答案,但其内部概率分布并不精准。这有点像一个擅长猜题的学生——他能答对,但如果你追问他"你有多确定?",他其实不太笃定。Qwen系列相比之下表现更"言行一致",LBS相对更高。

Q3:BloomBench为什么要同时提供英语和阿拉伯语版本?

A:当前绝大多数AI评测基准都以英语为中心,造成对非英语语言AI能力的系统性忽视。阿拉伯语是超过四亿人使用的语言,但针对阿拉伯语的多模态评测资源极度匮乏。BloomBench的双语设计不只是翻译,而是确保语义和认知层次的完整一致,目的是揭示AI在跨语言认知迁移上的真实差距,推动更具包容性的多语言AI发展。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-