微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 Upstage AI研究员揭示:当AI被要求填写一张完整的表格,它究竟在哪里翻车了?

Upstage AI研究员揭示:当AI被要求填写一张完整的表格,它究竟在哪里翻车了?

2026-07-01 08:12
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-01 08:12 科技行者

这项由Upstage AI发布的研究成果以预印本形式刊载于arXiv,论文编号为arXiv:2606.27595v1,发表于2026年6月25日,计划发表于AAAI(美国人工智能促进协会)会议论文集。

---

**你有没有遇到过这样的情况:**让一个聪明的助手帮你列出某个清单——比如"所有在韩国运营的低成本航空公司,以及它们的母公司、成立年份、主要枢纽机场和现有飞机数量"。结果助手信誓旦旦地回来了,清单看着挺全,但仔细一核对,发现某家航空公司的飞机数量写错了,另一家的成立年份对不上,还有一两家完全被漏掉了。

这种"感觉答对了但其实错了一半"的现象,正是这篇研究的核心关切。Upstage AI的研究人员花了大量精力来度量这件事:当AI被要求不只找一个答案,而是找出一整套完整的结构化信息时,它到底表现得怎么样?

---

一、为什么"找全一张表"比"找到一个答案"难得多?

现有的大多数AI搜索测试,关注的是"深度"——就像侦探追查一个藏得很深的秘密,答案隐藏在重重线索背后,AI要顺着蛛丝马迹找到那唯一的正确答案。但现实生活里,我们更常遇到的挑战其实是"宽度"——不是找一个答案,而是把某个主题下所有相关条目都列出来,而且每个条目还要附上若干属性信息。

用一个比喻来说,深度任务像是在一本厚厚的历史书里找到"某位皇帝的确切出生日期",而宽度任务则像是"把这本书里所有皇帝的名字、在位年限、出生地和重大政绩全部列成一张表"。前者考验的是耐心和推理,后者考验的是全面性和细心——你不能漏掉任何一个皇帝,也不能在某个皇帝的在位年限上随手填个不确定的数字。

来自英语世界的WideSearch基准测试已经证明,即便是最顶尖的AI,在面对这类"填表"任务时也会频繁犯错:漏填行、填错单元格、搞不清楚表格的范围边界。但WideSearch是英语的,而且要靠人工手动构建,成本极高。这篇研究的目标,是把这套评测体系搬到韩语世界,同时解决构建成本的问题。

---

二、KO-WIDESEARCH:一套专门测试AI"填表能力"的韩语关卡

研究团队构建了一个名为KO-WIDESEARCH的评测基准,专门用于测试AI在韩语网页上进行"穷举式集合枚举"的能力。每道题目都会指定一个父级实体——比如某个电视节目的某一季、某个朝代、某个联赛、某个行政区域、某次选举——然后要求AI列出该实体下的所有成员,并填写每个成员的若干属性,最终输出一张完整的表格。

整套基准包含228张表格,涵盖190个不同的父级实体,横跨16个领域类别,包括科学、政府、体育、媒体等。这些表格中共有4262行黄金标准数据和14560个属性单元格,全部来自真实的韩语网络资源,并经过严格的去污染筛查。

为了让这套评测不只是单一难度,研究团队设计了三个难度层级,并且通过两个独立的"旋钮"来控制难度。第一个旋钮是表格宽度,即每行需要填写多少个属性列。第二个旋钮则是成员维度——最简单的情况下,成员是一个单一列表(比如"所有韩国低成本航空公司"),而更难的情况下,成员本身就是一个二维网格(比如"每个省份×每次选举"的组合),这叫做"二维复合主键"。

以贯穿整篇论文的示例任务为例:要求AI列出韩国17个广域地方自治团体(省和市)在第七届和第八届地方选举中的当选首长,并附上政党、投票率、当选者年龄和得票率。由于每个省份都要参加两次选举,成员就构成了17×2=34行的网格。这34行中,选举结果可以从结果页面找到,但每位当选者的年龄则需要去另一个页面查找——这就是"跨来源"属性,也是让任务变得真正困难的地方。

简单级(EASY)的表格只有3列左右,成员是一维列表;中等级(MEDIUM)有5列左右,成员可能是一维也可能是二维;困难级(HARD)有7列左右,成员一定是二维网格。整体来看,228张表格中有88%需要从多个页面获取信息,而不是一个页面就能搞定。

---

三、这张表的质量是怎么保证的?——三道独立验证关卡

构建这样一套评测基准,最大的挑战不是出题,而是确保"黄金答案"本身是完整且正确的。手动核实每张表格的每个单元格,成本极高,于是研究团队设计了一套自动化的"构建与验证"流水线。

流水线的第一步,是让一个"构建智能体"通过搜索、打开网页、查找内容这三种工具,对每道题目进行穷举式搜索,自动生成黄金答案表格。时效性强的属性(比如"当前机队规模")会明确锁定到一个特定日期,以保证答案稳定。

生成之后,每张表格要通过三道独立的验证关卡,任何一道不通过都会被拒绝。第一道关卡检验"非记忆性":让一个没有网络访问权限的封闭模型尝试从记忆中复现答案,如果它复现成功(单元格正确率达到50%以上),说明这道题太容易,靠记忆就能答出来,应该被淘汰。第二道关卡检验"完整性":让另一个独立智能体重新从零枚举成员,两个结果的集合重叠度必须达到70%以上,以此作为黄金答案确实覆盖了所有成员的代理证明。第三道关卡检验"跨来源属性验证":一个独立的事实核查者从头重新查找每个属性值,与黄金答案对比,低于60%一致率的列被标记为"来源不稳定"并从题目中删除,至少保留一个经过独立验证的属性列才算通过。

除了这三道验证关卡,研究团队还专门设计了一个对数字比较感知的"归一化比较器"。原因在于,如果用粗糙的字符串匹配来对比"12,742 km"和"12742",会把明明正确的答案判错。这个比较器能够在相同精度下比较日期(年份相同就算匹配),去掉千位分隔符和单位后再比较数字,并允许5%的相对误差,同时对人名和地名进行归一化文本匹配。这同一个比较器不仅用于验证黄金答案,也用于给AI的输出打分,保证了评分标准的一致性。

---

四、用四把尺子来量AI的"填表能力"

评测框架采用了四个层层递进的指标,像是从外到内剥洋葱,每一层都更严格。

最外层是"成员F1",衡量AI是否找到了正确的行集合——有没有漏掉任何一个成员,有没有凭空捏造一个不存在的成员。以选举任务为例,就是AI是否恢复了完整的34个(省份×选举届次)组合。这是最基础的要求:你得先知道有哪些行,才谈得上填每行的内容。

第二层是"列F1",在已经正确匹配到行之后,衡量每个属性单元格的填写正确率。这把尺子告诉你:对于AI找到的那些行,它填的属性值有多少是对的。

第三层是"行F1",要求一行中的所有单元格都正确,才算这一行通过。哪怕34行里的某一行只有"投票率"这一格写错了,整行就不算正确。这是非常严格的要求。

最外层也是最严格的是"表格成功率",要求整张表格从第一行到最后一行,每个单元格都完全正确,才算这道题通过。这对应的是现实世界里"你交给我的那份报告完全可用"的标准。

---

五、二十个AI系统参加了这场"填表大考",结果怎么样?

研究团队将每个被测系统配置为一个网页搜索智能体,给定固定的30次迭代预算(每次可以批量调用多个工具)和单次尝试机会,要求它穷举集合并返回一张结构化表格。被测系统共20个,分为三类:专有前沿模型(GPT-5.5、Claude系列、Gemini系列)、开源模型(DeepSeek-V4-Pro、GLM-5.1、Gemma-4-31B、DeepSeek-Chat、Qwen3.6-35B)以及韩语专项模型(Solar-Open-2-preview、A.X-4.0、K-EXAONE-236B)。

结果呈现出一个清晰而一致的模式:所有系统都能比较好地找到成员集合,但在填满每一行的属性时大幅失分。成绩最好的GPT-5.5,其成员F1高达92.8,意味着它几乎找到了所有应该找到的行;但行F1只有53.7,也就是只有大约一半的行是每个单元格都填对的;表格成功率更是仅有19.3,每五道题里只有不到一道是整张表格完全正确的。

Claude-Opus-4.7在成员F1(94.6)和列F1(75.6)上甚至略微领先,体现了极强的成员识别和逐单元格填写能力,只是行F1(51.6)和表格成功率(15.8)同样难以突破这道天花板。开源阵营里,DeepSeek-V4-Pro以45.0的行F1挤进了专有模型的中游——它的表现超过了GPT-5.4、Claude-Sonnet-4.6以及所有更小规模的专有模型,成为开源模型中最接近前沿水平的存在。

三个韩语专项模型的表现令人意外地令人失望。A.X-4.0的行F1为24.2,Solar-Open-2-preview为24.4,K-EXAONE-236B为17.5,三者都落在开源模型的底部区间,与前沿模型(53.7)相比差距悬殊。这说明单纯的韩语流畅度并不能弥补在长链搜索和穷举式逐格填写上的能力缺口。

---

六、难度越高,摔得越狠——两个"旋钮"的威力

沿着难度梯度拆解数据,能看到更清晰的规律。随着表格宽度增加和二维复合主键的引入,行F1对每个系统都稳步下降。GPT-5.4-mini从简单级的42.6一路跌到困难级的18.8,DeepSeek-V4-Pro从50.7跌到36.9。成绩最强的GPT-5.5在困难级仍然维持在48.1,是唯一在困难级依然接近50分的系统。

有趣的是,成员F1在各个难度级别之间基本保持平稳,甚至在困难级略有上升。原因在于,困难级的任务大量采用了体育赛季类的二维网格,这类任务的成员(比如"哪些球队参加了哪些赛季")往往是系统性的、可以被规则枚举出来的,所以找全成员反而更容易。这说明随着难度上升,成员识别能力并没有退化——真正垮掉的是逐格填写的准确率。

关于跨来源的影响,由于27张单一页面来源的表格全部属于简单级,而中等级和困难级的表格全部需要跨来源查找,这两个维度(难度和跨来源性)之间存在高度相关,使得难以单独量化跨来源带来的影响,研究团队也坦诚了这一局限。

---

七、哪类单元格最容易填错?答案出乎意料

在一个仪器化的三模型子集上,研究团队对每种单元格类型分别统计了列F1,结果揭示了一个清晰的排序:日期类(58)和人名类(56)单元格最容易填对,数字类(55)和枚举类(51)居中,而自由文本类(49)最容易填错。

这个发现的意义在于,它说明问题的根源是"找到并理解正确值",而不是"把正确值格式化成要求的样子"。因为那个归一化比较器已经消除了大部分格式层面的差异——日期粒度不同不会被判错,有无千位分隔符不会被判错,名字的轻微变体也不会被判错。所以剩下那49%失分的自由文本单元格,是真的找错了值或者干脆编造了一个听起来合理但实际上错误的值。

为了进一步验证这一点,研究团队还做了一个"语义评审"实验:用GPT-5.4-mini作为语义裁判,对那些被确定性比较器判错的软类型单元格(人名、地点、自由文本)重新审核,看看AI的答案是否在语义上等价于黄金答案(比如"首尔,韩国"和"首尔"是同一个意思)。这番重新评分把行F1向上修正了0.8到4.9分,而且修正幅度与模型能力正相关——DeepSeek-V4-Pro获得了4.9分的修正,最弱的模型只获得了0.8分。这意味着强模型剩余的错误更多是表面形式问题,而弱模型剩余的错误是实实在在答错了——不同的人物、不同的区域、不同的数值。

---

八、搜索得更多、花钱更多,能解决问题吗?

研究结果给出了一个明确的否定答案,而且这个答案让人印象深刻。

在搜索工具调用次数上,20个系统里搜索得最努力的两个——Qwen3.6-35B每道题平均调用66次工具,Solar-Open-2-preview平均57次——恰恰是得分最低的两个(行F1分别为16和24)。反过来,GPT-5.5和Claude-Opus-4.8以适中的工具调用量(分别是33次和26次)拿下了最高分。这说明,瓶颈不在于搜索量,而在于智能体组织和验证表格的能力。那些大量搜索的模型,其实是在重复搜索相似的内容而找不到出路,属于"乱撞"而非"汇聚"。

在成本效益上,GPT-5.5每道题花费约0.87美元,行F1为53.7;而DeepSeek-V4-Pro每道题仅花费约0.23美元,行F1就达到了45.0。换句话说,从最好的开源模型到最好的专有模型,那最后9个百分点的行F1差距,需要多付大约四倍的钱。Claude-Sonnet-4.6在91%的任务上都用满了30次工具调用,最终行F1只有43.6,而Claude-Opus-4.8只在40%的任务上用满了30次,却拿下了52.9的行F1。

---

九、AI在哪个环节开始出错?——失败的四个阶段

研究团队把每道题的失败归因到最早发生问题的环节,形成了一幅清晰的失败地图。对于能力较强的系统来说,找成员这件事基本没问题——Claude-Opus-4.7只在18%的题目上出现了成员识别错误,但随后有66%的题目是因为至少一个单元格填错而功亏一篑,最终只有16%的题目完全正确。

对于能力较弱的系统,失败发生得更早:GPT-5.4-nano和DeepSeek-Chat在46%到52%的题目上就已经在成员识别阶段失败了——行都没找全,更谈不上填属性。Claude-Haiku-4.5有一个特殊的失败模式:24%的题目根本没有输出一张可解析的表格,直接得零分。

韩语专项模型各有各的失败方式。A.X-4.0在成员识别上和中等水平的开源模型相当(成员F1 71.7),但单元格填写能力极差(行F1 24.2);Solar-Open-2-preview则有一个结构性输出问题,只有62.7%的题目返回了可解析的表格,其余的都变成了散文叙述或编号列表;K-EXAONE-236B落在开源模型的底部,行F1只有17.5。

此外,成员识别在精确率和召回率两个方向都基本平衡——GPT-5.5的成员识别精确率为85,召回率为86;DeepSeek-V4-Pro分别是71和71。这说明AI不是系统性地漏掉成员,也不是系统性地凭空捏造成员,而是两种错误大致对称地存在。真正的崩溃发生在下游:全行精确率和召回率双双跌到25到37,这是"找到了行但单元格填错了"的典型特征。

表格成功率这个最严格的指标,是最能说明问题的,但也是最不能区分系统间差异的。几乎所有系统都趴在个位数,最强的GPT-5.5也只有19.3。Solar-Open-2-preview靠着把少数简单任务做得完全正确,表格成功率(9.7)反而高于GPT-5.4-mini(5.7),尽管它的行F1(24.4)远低于后者(33.3)——因为它们在做法上是完全相反的:一个是偶尔把一道简单题做全对,其他全崩;另一个是在大多数题目上都拿到了部分分数。这就是为什么研究团队以行F1作为主要排名依据,而非表格成功率。

---

十、更大的集合更难填吗?大集合未必更难

按照常识推断,如果一张表格有30多行,那肯定比只有10行的表格更难填全、填对。然而数据并不支持这个直觉:把行F1按黄金答案的行数分组来看,8到15行的任务平均行F1为35.4,16到30行的为31.2,超过30行的为35.0,三者基本持平。最大的那些任务集合通常是系统性的体育赛季网格,成员本身就是可以规则枚举的,所以集合大小本身并不是难度的主要驱动因素——表格宽度和二维复合主键才是。

在各类别的表现上,研究团队把行F1按主题类别汇总,大多数类别集中在0.30到0.40之间:体育类(0.35)、地点与地区(0.39)、娱乐媒体(0.35)、政府政治(0.30)、科技(0.30),历史文化(0.46)和经济政策(0.50)稍高,而文学书籍类以0.19垫底——因为这类主题的权威列表在网页上分散且难以获取,属性值也最难确认。

---

说到底,这场"填表大考"揭示的是什么?

归根结底,这篇研究展示了AI智能体在面对"宽度任务"时的一个结构性短板:它们很擅长找到答案集合的轮廓,却在把每一格都填对这件事上举步维艰。这个差距不是用更多搜索次数或更多金钱能弥补的,它指向的是一种更本质的能力——在搜索了很多页面之后,还能准确地把分散的信息组织成一张完整而无误的表格,并且在不确定时宁愿留空也不要乱填。

对于普通用户来说,这意味着当你让AI帮你整理"某类事物的完整清单及其属性"时,你最好把AI交回来的答案当作一个初稿,而不是最终版本——特别是那些需要从多个不同页面查找的属性值,很可能存在遗漏或错误。对于AI开发者来说,这个基准指出了一个值得专项改进的方向:如何在长时间的搜索过程中维持对"我还需要找哪些格子的信息"的精确追踪,并在发现不确定时选择诚实地留白。

KO-WIDESEARCH的构建流水线和评分代码已经以MIT许可证开源,而评测数据集本身则以申请方式分发,以防止AI通过搜索找到已经公开的黄金答案来"作弊"。有兴趣深入了解的读者可以通过arXiv编号2606.27595查阅完整论文。

---

Q&A

Q1:KO-WIDESEARCH基准和普通的AI问答测试有什么区别?

A:普通的AI问答测试通常只考察AI能否找到单一的正确答案,比如某人的出生日期或某个事件的时间。KO-WIDESEARCH测试的是完全不同的能力——AI能否穷举某个类别下的所有成员,并为每个成员填写多个属性值,最终输出一张完整无误的表格。一个是"找到答案",另一个是"填好整张表",后者要求AI同时做到不漏行、不多行、每个单元格都填对。

Q2:为什么韩语专项模型在KO-WIDESEARCH上的表现比通用前沿模型差那么多?

A:韩语流畅度在这个任务里只是基础条件,而不是决定性因素。KO-WIDESEARCH真正考察的是在长时间搜索后维持对整张表格状态的追踪,以及在多个页面间穿梭查找各个属性值的能力。韩语专项模型在搜索策略、结构化输出和跨来源信息整合上存在明显短板,有的连可解析的表格都无法稳定输出,这些问题不是单纯的语言能力能弥补的。

Q3:KO-WIDESEARCH里的"二维复合主键"任务到底难在哪里?

A:普通的列表任务只有一个维度,比如"所有球队"。二维复合主键任务的成员本身是一个网格,比如"每个省份×每届选举",意味着AI不仅要找到所有省份,还要确保每个省份在每届选举里都有对应的条目,一共34行。漏掉任何一个省份的任何一届选举,就会丢失一整行;加上每行的属性往往来自不同页面,错误会在两个维度上叠加,让整张表格的正确率大幅下降。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-