微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI"查题作弊"的漏洞有多大?香港浸会大学等机构揭示自动事实核查系统的致命盲区

AI"查题作弊"的漏洞有多大?香港浸会大学等机构揭示自动事实核查系统的致命盲区

2026-08-06 13:27
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-06 13:27 科技行者

这项由香港浸会大学、香港大学及北京师范大学-香港浸会大学联合国际学院共同完成的研究,发表于2026年11月在巴西里约热内卢举办的ACM国际多媒体会议(MM '26),论文DOI为10.1145/3767308.3836298,arXiv编号为2607.23514。有兴趣深入了解的读者可通过上述编号查询完整论文。

一、一个让人不安的比喻:考官手里的题目早就被泄露了

考虑这样一个场景:你花了大量时间精心设计一套考试题,打算用它来测试学生的真实解题能力。但你不知道的是,这些题目早就以各种形式出现在学生平时看的参考书里了。学生拿到卷子,不假思索地答出来——不是因为他们真的理解了解题思路,而是因为他们之前见过这道题的答案。你的考试结果看起来很漂亮,但它根本没有测出学生的真实水平。

这个场景,正是当今人工智能事实核查领域正在悄悄发生的事情。

近年来,网络上虚假信息泛滥,靠人工逐条核查根本来不及,于是研究者们开发出了"多模态自动事实核查系统"——简单来说,就是一种能够自动判断某条消息是真是假的AI。这类系统的工作原理分为两步:先从网络上搜索证据,再根据证据判断消息的真伪。判断能力越强,系统就越有用。

为了测量这些AI系统到底有多厉害,研究者们建立了"评测基准"——一批由专业事实核查机构审定过的真实案例,用来给AI打分。然而,这批研究人员发现了一个令人不安的漏洞:许多评测题目,AI早就在训练时"见过"了。就像那个泄题考场一样,AI的高分并不代表它真的有本事,只是因为它"背过答案"。

更麻烦的是,为了堵住这个漏洞,研究界最近推出了"动态评测"的新方案——专门收集AI知识截止日期之后才发布的新鲜内容来出题,以为这样就万无一失了。但这批研究人员的实验结果告诉我们:这个方案虽然有所改善,却远没有彻底解决问题。

二、"污染"这件事到底是怎么发生的

要理解这个问题,先得搞清楚AI是怎么"学习"的。现代大型语言模型,比如GPT系列或Gemini系列,是用海量的互联网文字内容训练出来的。这些内容包括新闻报道、百科词条、社交媒体帖子、官方文件……几乎互联网上能找到的文字,都有可能进入训练数据。训练完成之后,AI就有了一个"知识截止日期"——这个日期之后发生的事情,它原则上是不知道的。

事实核查系统在工作的时候,本应老老实实地去网上搜索证据,然后根据搜到的新鲜信息来判断。但如果评测题目里的内容,AI在训练时已经见过,它就可以直接从"脑子里"调出答案,根本不用费心去搜证据。这就像一个侦探接到案子,还没去现场调查,就已经从记忆里知道凶手是谁了——表面上破案速度极快,实际上根本没发挥侦探的本事。

研究团队把这种现象称为"污染"(contamination)。被污染的评测题目就像是泄露了的考题,让AI能够"背答案"而不是"真解题",从而虚高了评分。

三、他们怎么检测"污染":一套精妙的相似度比对流程

为了量化这个问题,研究团队设计了一套系统性的检测方案,整个过程可以用"比对读书笔记"来理解。

首先,对于评测集中的每一条待核查内容,团队让AI在没有网络搜索权限的情况下,仅凭自己的"脑内知识"写出一篇事实核查文章。接着,他们去抓取专业事实核查机构真正写的权威文章作为标准答案。然后,用另一个AI从这两篇文章里分别提取出关键证据条目,去掉广告、免责声明等无关内容,让比较更加纯粹。最后,用匈牙利算法——一种专门用于最优匹配的数学方法——计算AI生成的证据条目和权威证据条目之间的相似程度,得出一个"污染分数"。

相似度越高,说明AI的脑内知识和权威证据越吻合,也就意味着AI可能根本不需要去搜证据就能答题——这条题目就被标记为"疑似污染"。

为了确保相似度衡量的准确性,团队同时使用了三种不同的相似度计算方式。第一种叫METEOR,是一种传统的文字面相似度指标,专门看两段文字用了多少相同的词汇;第二种和第三种分别是Gemma-Emb-0.3B和Qwen3-Emb-0.6B这两个语义向量模型,它们能理解语义层面的相似度,哪怕用词完全不同但意思相近的两段话,它们也能识别出来。

为了确定"多相似才算污染",研究团队专门找了两名拥有新闻学或事实核查相关背景的研究生,让他们人工审核了180条内容,打出了"污染"或"不污染"的标签,然后用这批人工标注的结果来校准自动检测的阈值。结果显示,对于两种语义模型,阈值设在0.6时与人工判断的吻合率最高,分别达到了75.6%和82.2%,因此最终采用了这个阈值。

四、两个考场的成绩单:静态基准和动态基准的污染对比

研究团队选取了两个评测数据集进行对比,一个是目前被广泛使用的静态基准AVeriTeC,另一个是他们自己新构建的动态基准ClaimReview2025Q4。

AVeriTeC是由50家事实核查机构的案例汇编而成的经典数据集,包含491条经过专业核查的真实内容。这个数据集里最新的内容发布于2020年10月,而如今被用来评测的大型AI模型,其知识截止日期普遍在2023年或更晚——也就是说,AVeriTeC里的内容,AI在训练时大概率已经见过了。

ClaimReview2025Q4则是研究团队依照最新的动态评测规范,从ClaimReview项目中收集的2025年第四季度(10月至12月)发布的英文内容,共901条。这些内容来自国际事实核查网络(IFCN)认证的机构,经过去重和质量筛查,删除了会直接透露真伪结论的描述,以及不完整或含有多余元信息的条目,确保每条内容都是独立完整的事实主张。这批内容发布于大多数AI模型的知识截止日期之后,理论上应该是AI"没见过"的。

检测结果用数字说话,非常清晰。对于AVeriTeC,六个被测试的AI模型中,几乎所有模型在三种指标下的平均污染分数都超过了阈值,GPT-4o-Mini在METEOR指标上达到了26.80%,Gemini-3.0-Pro在两个语义指标上分别达到了67.00%和65.78%。

切换到ClaimReview2025Q4之后,污染程度确实降低了。在METEOR指标下,各模型的污染分数下降了2.92到4.95个百分点;在两个语义指标下,下降幅度更大,在6.20到11.16个百分点之间。这说明使用知识截止日期后的新鲜内容来出题,确实能有效减少污染。

然而,麻烦在于"减少"并不等于"消除"。当研究团队统计"在三种指标下都被判定为污染"的条目比例时,发现各个模型的比例从17.09%到29.30%不等。换句话说,即使在这批"理论上全是新题"的动态基准里,仍然有将近两成到三成的题目,AI依然能靠脑内知识作答。

其中最"博学"的要数Qwen3.5-122B-A10B,这个模型在三种指标下的污染比例分别高达35.18%、55.94%和50.94%,在所有被测试的模型里排名第一。由于这个模型的知识截止日期并未公开,研究团队推测,它的训练数据可能涵盖了2025年第四季度的在线内容。

五、新题目为什么还是"老题目":三种隐藏的作弊路径

既然这批内容是2025年底才发布的,为什么AI还是能靠记忆作答?研究团队通过案例分析,找出了两大根本原因。

第一类原因,是内容本身涉及的事实早就存在于AI的训练数据里。某条2025年11月1日发布的内容主张"前美国总统里根于1986年签署了《紧急医疗救治和分娩法》,要求急诊室向任何人提供急救服务,不论其移民身份"。这条内容虽然是新发布的,但它核查的是一个1986年的历史事实,维基百科等来源早就详细记载了这部法律的内容。AI当然早就知道答案,根本不需要去搜证据。类似地,另一条2025年12月25日发布的内容说"英格兰某小镇为了让一只海象睡觉而取消了跨年夜烟火表演",这件事实际上发生在2022年,BBC当时有详细报道,早已被纳入AI的训练语料。还有一条关于英国免费电视牌照年龄门槛的内容,涉及的是2020年确立的政策,此后被反复报道,同样是AI的"老知识"。

第二类原因更为微妙:有些内容的表述是全新的,但验证其真伪所需的推理,只需要把两条早已公开的事实拼在一起就能完成。一条2025年11月22日发布的内容称"巴伦·特朗普宣布参加2028年美国参议员竞选"。这个说法本身是新鲜的,从未以这种形式在AI训练数据里出现过。但要判断它是否可信,只需要知道两件事:巴伦·特朗普的出生年份是2006年,以及美国宪法规定参议员候选人须年满30岁。把这两个早就广为人知的事实加在一起,一秒钟就能算出2028年他才22岁,距离法定年龄差了8年,这个说法自然是假的。AI完全不需要搜索任何新信息,就能给出正确答案。

这两类原因说明,单纯看内容的发布日期,并不能保证它对AI来说是真正"没见过的新题"。内容的发布时间只是一个粗糙的代理指标,实际上的知识新鲜程度,需要更精细的方法来判断。

六、"作弊"之后成绩单到底虚了多少:对AI评分的具体影响

知道了污染存在,研究团队进一步测量了它究竟把AI的成绩单虚高了多少。他们用DEFAME这个目前最先进的自动事实核查框架,以六个AI模型为核心,在动态基准的"疑似污染"题目和"未污染"题目上分别进行了测试,然后比较两组的准确率和宏F1分数(一种综合衡量分类系统表现的指标)。

结果令人吃惊。每一个被测试的AI模型,在"污染"题目上的表现都比"未污染"题目上要好。对于Gemini-3.0-Flash,污染组的宏F1分数比未污染组高出了11.34个百分点;Qwen3.5-122B-A10B的准确率差距高达10.88个百分点;GPT-4o-Mini和Gemini-3.0-Pro也分别有9.59和8.57个百分点的宏F1差距。

更关键的是,污染不仅让各个模型的绝对分数偏高,还扭曲了模型之间的排名。在污染题目上,Gemini-3.0-Flash的宏F1最高,达到61.22%,排名第一。但在未污染题目上,成绩最好的却是GPT-5.2,宏F1为52.81%。如果研究者只看污染数据集上的结果,会得出"Gemini-3.0-Flash最厉害"的结论;但在真正公平的条件下,这个结论就不成立了。

研究团队还深入分析了AI在处理污染和未污染题目时,搜索行为上有什么不同。他们追踪了AI在做事实核查时发出的每一个搜索查询,并把相邻两次查询之间的关系分成四种类型:缩小范围(在原来的查询上加限定条件)、扩大范围(放宽条件)、探索新角度(转向同一话题的不同侧面)、重复查询(几乎原样重发同一个查询)。

统计结果显示,在面对污染题目时,AI发出的"探索新角度"型查询明显少于面对未污染题目时。换句话说,当AI"认识"这道题时,它会非常精准地直奔答案而去,不需要在证据空间里广泛探索;而当AI真的面对陌生内容时,它需要尝试更多不同的搜索角度才能找到有用的证据。这个发现揭示了一个有趣的机制:污染题目让AI能够"精准作弊",节省了探索证据的步骤,从而在统计上显得更聪明、更准确。

七、排除"作弊"之后,顶尖AI的真实水平究竟如何

把污染的阴影彻底扫清之后,AI的真实成绩如何?研究团队构建了一个"严格去污染评测集":只保留那些在六个AI模型下、在三种相似度指标下,都被判定为"未污染"的题目。最终这个评测集里有154条内容,其中支持类占12.34%,驳斥类占68.18%,证据不足类占19.48%。

在这个公平的考场上,六个模型的宏F1分数全部低于56%。表现最好的是DeepSeek-V3.2,宏F1为55.93%;其次是GPT-5.2,为51.66%;Gemini-3.0-Pro和Gemini-3.0-Flash分别是50.88%和48.75%;Qwen3.5-122B-A10B为47.04%;表现最差的是规模较小的GPT-4o-Mini,宏F1仅有39.14%。

这组数字说明,在真正全新的、需要实际搜证的内容上,当前最顶尖的AI事实核查系统距离实用化仍然有相当大的差距。宏F1分数低于56%,意味着系统在处理不同类别的内容时,综合准确率还不够理想。尤其是类别分布本身就不均衡——驳斥类占了将近七成,这让系统容易偏向预测"这是假的",而在支持类和证据不足类上表现较差。

研究团队还注意到,规模更大的模型整体上表现更好,GPT-4o-Mini这个规模相对较小的模型排在末位,印证了模型规模对事实核查能力有实质性影响。

八、这项研究留下了什么:给未来出题人和研究者的几条启示

研究团队在文章结尾提出了若干值得关注的方向。

首先,仅凭发布时间来筛选"新鲜题目"是不够的,未来的动态基准需要更主动地检验内容的知识新鲜程度,而不是简单假设"新发布就等于AI没见过"。这项研究提供的检测流程,本身也可以作为数据处理工具,用来在构建评测集时主动过滤掉疑似污染的条目。

其次,研究者们指出,评测集里驳斥类内容占比过高(约七成),这种标签分布的不均衡本身就是一个问题,会让系统的综合表现评估产生偏差。未来的评测集构建应该更注重各类别的均衡分布。

另外,研究团队坦承,他们使用的相似度比对方法,主要捕捉的是"可观察到的证据重叠",对于那些更隐蔽的污染形式——比如AI通过更迂回的推理链条利用了训练数据里的某些知识——可能仍然难以识别。这意味着实际的污染程度,可能比本研究测量到的还要更严重。

最后,这项研究的所有实验均以英文内容为主。面对多语言的全球信息生态,不同语言的评测集是否存在类似乃至更严重的污染问题,还需要进一步的研究来回答。

说到底,这项研究揭示的问题,核心是"我们以为在测量真实能力,实际上可能只是在测量AI的记忆力"。这在任何依赖数据驱动评测的领域都是一个严肃的警示。当我们看到某个AI系统在新闻核查上得了高分,在声称能识别网络谣言,在宣传自己有多可靠的时候,或许应该先问一句:它做那道题之前,有没有可能已经在某个地方见过答案了?

Q&A

Q1:自动事实核查系统中的"污染"是什么意思?

A:自动事实核查系统的"污染"指的是评测题目里的内容已经出现在AI的训练数据中,导致AI可以直接从"记忆"里调出答案,而不必真正去网上搜索证据。这会使AI的评测得分虚高,无法反映它在面对真正陌生的、全新内容时的实际能力。

Q2:动态评测基准为什么还会存在污染问题?

A:动态基准虽然只收录知识截止日期之后发布的内容,但这并不意味着内容本身对AI来说是全新的。一种情况是内容涉及的事实本身是历史旧事,比如某项1986年颁布的法律,AI在训练时早就学过;另一种情况是内容虽然表述新颖,但只需把两三条AI早已知道的旧知识拼在一起就能判断真伪,不需要任何新信息。

Q3:去除污染后,目前最好的自动事实核查AI准确率大概是多少?

A:在研究团队构建的严格去污染评测集上,表现最好的DeepSeek-V3.2宏F1分数为55.93%,GPT-5.2为51.66%,其余模型更低,最差的GPT-4o-Mini仅有39.14%。所有模型的宏F1均低于56%,说明当前AI事实核查系统的真实水平仍有较大提升空间。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-