
这项由中国科学技术大学与美团联合开展的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.12871,感兴趣的读者可通过该编号查询完整论文。
说起来,每个人每天都在搜索信息。早上起床想知道今天天气,中午吃饭前要看看餐厅评价,晚上刷手机发现热搜里某所大学排名大变动,立刻想知道细节。这些都是再普通不过的"日常搜索需求"。现在,有一类叫做"搜索智能体"(Search Agent,简称SA)的AI系统,号称能帮你把这些问题都查个明白——它们会自动浏览几十上百个网页,把零散信息整合成一篇像样的报告交给你。
问题是,它们到底做得有多好?用户满不满意?现有的评测工具根本说不清楚。研究团队发现,现有的测试方法有两个致命短板:一是测试题目都是专家精心设计的"专业问题",和普通人每天真正关心的事情相差甚远;二是打分方式太粗糙,只能给出一个笼统的总分,看不出哪里好、哪里差,更不能反映用户的真实感受。于是,这支来自中国科学技术大学和美团的联合研究团队,决定亲手打造一套全新的评测基准,取名叫做**DailyReport**,专门用来考察这些AI搜索助手在面对真实日常需求时的真实水平。
一、搭建考场:这套考题从哪里来
在解释这套评测体系的设计之前,有必要先说清楚它究竟要解决什么问题。现有的同类评测工具,要么是出一些有唯一正确答案的"硬核题"——比如"2019年某公司的营收是多少"——这类问题考的是AI能不能找到一个特定事实,与用户写报告、做决策的真实需求并不一样。要么是让专家出一些研究级别的深度问题,比如要求AI撰写一份学术领域的综述报告,这种场景普通用户根本遇不到。
DailyReport的思路完全不同。研究团队的起点不是专家书房,而是微博、小红书、知乎、Facebook、Reddit、Twitter这些真实用户聚集的地方。他们收集了这些平台上的热搜话题和用户评论,从中提炼出普通人真正想问的问题。打个比方,高考季来临,微博上铺天盖地都是关于2026年QS大学排名的讨论,用户们纷纷追问:中国哪些大学进了全球前100?它们各自有什么优势和短板?这种问题才是真实的日常搜索需求。
整个题库的建设耗费了人工标注超过500小时,参与者来自不同地区、不同教育背景,熟悉中西方媒体生态,以确保题目能覆盖足够广泛的用户群体。最终,题库包含150道开放式任务,关联着3546条评分标准,横跨10个大类领域和35个细分方向——从政治法律、科技行业到消费娱乐、体育赛事,几乎把现代人的日常关注点都囊括其中。
这150道题分为两种类型。一种叫做"检索导向型",共100道,侧重于让AI准确找到并整合关于特定对象的客观信息,比如列出进入QS前100的中国大学、给出它们的排名变化和各项指标得分;另一种叫做"分析导向型",共50道,主题更宏观、更开放,要求AI自主判断哪些信息值得关注并进行深度分析,比如分析某个动漫节如何体现了文旅商体展的协同模式。两种题型结合,更完整地还原了用户在现实生活中搜索信息的多样场景。
此外,由于这些题目都来源于时下热门话题,题库本身也会随着时代变化持续更新。这就避免了一个常见问题:AI系统可能已经在训练时"背过"那些固定的测试题,测出来的成绩虚高。DailyReport的题目永远追着最新的热点走,AI系统没有捷径可抄。
二、设计评判标准:不只是打个分,而是弄清楚"哪里出了问题"
有了考题之后,怎么打分是更大的挑战。这也是DailyReport最核心的创新之处。
研究团队用了一个很直观的例子来解释现有打分方式的问题。假设用户问的是"列出2026年QS前100的中国大学,并分析各自的优缺点"。如果AI连哪些大学进了前100都搞错了,后面关于优缺点的分析就是无稽之谈——分析的对象都是错的,分析本身还有任何价值吗?答案显然是没有。然而,传统的打分方式会把"找到正确的大学列表"和"分析优缺点"分开独立打分,各自乘以一个权重再相加,结果就是即使前半部分完全错误,只要后半部分写得天花乱坠,最终总分看起来还是不错。这显然不符合真实用户的感受。
DailyReport的解决方案是把每道题拆解成若干个"子任务",然后对每个子任务从三个完全独立的维度进行评分,形成一套"级联评分体系"。
第一个维度叫做"指令遵循",考察AI有没有正确理解并完整执行用户的要求。比如用户说要列出"前三名"大学,AI是不是真的列了三个,而不是两个或四个?用户要求分析"各自的优缺点",AI有没有真的给每所大学都分别分析,而不是混在一起泛泛而谈?这个维度是最基础的,评分结果是0、0.5或1三档。
第二个维度叫做"事实准确性",考察AI给出的具体信息是不是真实可靠的。比如它说某所大学的QS排名是第47位,这个数字是真的吗?它给出的这所大学的综合得分是真实数据吗?这个维度需要借助外部搜索工具进行实际核查,打分结果是0到1之间的连续数值,反映所有被抽查的具体说法中,有多少比例是经过核实正确的。
第三个维度叫做"推理合理性",考察AI的分析和论证过程是否符合逻辑。比如它说某所大学"工科实力全国领先,但人文学科相对薄弱",这个判断的依据是否充分、逻辑是否自洽?这个维度的评分不依赖外部核查,只需要审阅AI自己写的内容,看其论证过程有没有明显的逻辑跳跃、前后矛盾或不合常理之处,评分结果同样是0、0.5、1三档。
这三个维度的关键创新,在于它们并非独立存在,而是形成了一种"级联"关系。具体来说,只有当AI在"指令遵循"维度上通过了,才会进一步评估其"事实准确性"和"推理合理性"。如果AI连用户要问的对象都搞错了、找都没找对,那它关于这个错误对象的事实准确与否、推理合理与否,就都归零处理,不再计入有效得分。这种设计,让评分结果真正反映了信息链条上的依赖关系,而不是掩盖错误。
三、站在用户角度打分:什么叫"真正满足了我的需求"
三个维度的分数有了,怎么把它们合并成一个用户能感受到的综合评价,是另一道难题。
研究团队没有简单地把三个维度相加,而是设计了一套"以用户为中心的聚合算法"。这套算法的出发点是:不同的子任务对用户的重要程度是不一样的。以那道QS排名题为例,正确列出进入前100的大学,对用户来说是核心需求,如果这一点做错了,整个回答对用户来说就是废纸一张。而分析"第二名和第三名哪个理工科更强",则是锦上添花的附加价值,遗漏了令人遗憾,但主体需求已经满足。
为了量化这种重要程度的差异,研究团队专门请来了当初出题的专家,让他们评估:如果只有这一个子任务没完成,用户的满意度会受到多大影响?据此,每个子任务被标记为三种重要级别:最高级别对应"这个子任务没完成,用户会觉得这次搜索完全没用";中间级别对应"没完成这个子任务,用户体验会明显受损";最低级别对应"没完成这个子任务,但主要需求还是满足了"。
最终的"用户偏好得分"是一个1到4的整数,对应四种用户体验:1分代表"这个回答完全没用,用户白费力气";2分代表"有点用,但问题太多,用户体验很差";3分代表"基本满足主要需求,小问题有但影响不大";4分代表"完美,用户需要的全都有,几乎无可挑剔"。这套算法的逻辑是:如果连最核心的子任务都没完成,直接判1分;如果所有子任务都完成且各维度得分极高,才有可能拿到4分;其余情况根据重要子任务的完成情况和整体得分水平,在2分和3分之间判断。
为了验证这套评分体系的可靠性,研究团队做了大量的人工对照实验。他们从评测结果中随机抽取300个子任务样本,同时让真实用户和AI评分模型各自打分,再比较两者的一致程度。结果显示,AI评分模型在"指令遵循"维度的准确率达到了96.5%,甚至超过了人工标注者的88.4%。而整个用户偏好得分体系与真实用户打分之间的加权一致性系数(一种衡量两套评分体系是否一致的指标)达到了0.859,说明这套算法确实相当准确地还原了用户的真实感受。
四、实战检验:17个顶尖AI系统的成绩单
用这套考场和评判标准,研究团队对17个当前最先进的AI搜索系统进行了全面测试。这17个系统分为三类:第一类是"原生深度研究智能体",包括OpenAI的o3和o4-mini Deep Research、谷歌的Gemini Deep Research、Grok 3 Deep Research以及通义DeepResearch;第二类是"配备搜索工具的大型语言模型",包括Claude Opus 4.6、GPT 5.4、Gemini 3.1 Pro、GLM 5、Kimi K2.5和Qwen 3.5;第三类是"搭载Claude Code框架运行"的上述语言模型。
从用户偏好得分来看,所有17个系统的得分都在2到3之间徘徊,没有任何一个系统能达到3分这个"基本令人满意"的门槛。其中表现最好的是"配备搜索工具的GPT 5.4",得分为2.89,紧随其后的是同样基于GPT 5.4但搭载Claude Code框架的版本,得分为2.87。这意味着,即使是当前最顶尖的AI搜索系统,在面对普通用户的日常需求时,也只能勉强达到"有明显缺陷"到"基本可用"之间的水平。
三个维度的分项成绩揭示了更细致的能力格局。在"指令遵循"维度,几乎所有系统的得分都相当高,大多在0.93到0.99之间。这说明现代顶尖AI系统在理解用户要求这件事上已经相当成熟,基本上能搞清楚用户在问什么、要求什么格式、有什么限制条件。
然而,"事实准确性"是所有系统的共同软肋。得分最高的GPT 5.4(搜索工具版本)也只有0.835,原生深度研究智能体中表现最佳的Grok 3得分0.731,而表现较弱的系统甚至只有0.61左右。换句话说,即使是最好的系统,在给出的具体事实信息中,平均也有约16%是经不起核查的。AI能告诉你大学名字,但它报出的分数、排名变化数字,可能每6个就有1个是错的。
"推理合理性"维度的表现则相对参差不齐。原生深度研究类系统中,Grok 3和OpenAI o3的推理合理性较好,得分在0.856到0.909之间;但配备搜索工具的语言模型中,GPT 5.4以0.930的得分领跑,表现出色。整体来看,推理合理性普遍优于事实准确性,说明这些AI系统在"说话有逻辑"上比"说话有根据"做得更好。
三类系统的整体对比也很有意思。配备外部搜索工具的大型语言模型,总体上优于原生深度研究智能体,而搭载Claude Code框架的版本则介于两者之间,略逊于直接配备搜索工具的版本。原生深度研究智能体的相对弱势,可能因为这类系统为了兼顾响应速度、稳定性和成本,使用了经过特定调整的内部模型,而非最强版本的通用语言模型。Claude Code框架的轻微劣势则可能源于它本身是为编程任务设计的,处理搜索密集型任务时会引入一些不必要的冗余操作。
五、深挖失败原因:搜索次数和引用质量是关键
研究团队没有止步于统计总分,还深入分析了每个系统的行为过程,试图找出"为什么会失败"。
他们统计了每个系统在完成任务时调用搜索工具的次数。结果发现,搜索次数与最终得分之间的正相关关系最为显著——搜得越多,答得越好。这个结论看起来理所当然,但重要的是,它说明当前AI系统的失败很大程度上不是因为"不会分析",而是因为"搜得不够"。配备搜索工具的GPT 5.4平均每次任务调用搜索约50次,而一些表现较弱的系统只搜了十几次,差距悬殊。
在事实准确性方面,研究团队进一步分析了"引用"的作用。大多数AI系统会在给出的信息后面附上信息来源链接,这本来是提高可靠性的好习惯。但测试结果显示,问题出在两个环节上。第一个环节,引用的文章本身质量堪忧,即所引用的网页本身就包含错误或过时信息;第二个环节,即使引用的文章是准确的,AI生成的内容与引用文章之间的对应关系也存在偏差,简单说就是AI"说的"和它"引用的"并不一致。在所有系统中,这两个指标都远未达到理想水平,表现最差的系统引用准确性还不到0.55,意味着它们引用的来源有将近一半本身就靠不住。
六、不同领域、不同题型,表现差异明显
研究团队还细致分析了不同领域、不同题型下各系统的表现差异,结论颇具实际参考价值。
从领域分布来看,AI系统在"政治法律"和"产业经济"类话题上表现相对较好,在"体育娱乐"类话题上表现最差。背后的逻辑并不难理解:政治政策、法律法规、行业报告这类信息,通常有官方文件、权威媒体报道作为来源,信息可靠且结构清晰;而体育赛事、娱乐八卦的信息更新极快,各路说法满天飞,核实难度远高于前者。这意味着,你用AI搜索"最新政策解读"可能比搜索"球队当前状态分析"要靠谱得多。
从题型来看,"分析导向型"任务和"检索导向型"任务各有胜负。在"指令遵循"维度,分析导向型任务的得分普遍略高——因为这类问题要求分析的内容边界更模糊,AI更容易"自我发挥"地覆盖各种角度;而检索导向型任务要求的是特定的精确信息,稍有偏差就会扣分。然而,在"事实准确性"维度,分析导向型任务的表现却普遍更差——因为分析型问题要求AI从各种零散来源拼接信息,信息来源越杂乱,出错的概率就越大。在"推理合理性"维度,分析导向型任务则再次胜出,因为这类任务本身就聚焦于观点和逻辑,而非精确数字,AI擅长输出听起来合理的分析框架。
七、评测体系本身经得起考验吗
一套新的评测工具,自然要经受质疑:它的结果稳不稳定?评分标准靠不靠谱?
研究团队对此做了严格的自我检验。他们选取了三个有代表性的系统,各自重复评测三次,统计每次得分的波动幅度。结果显示,所有维度的标准差都极小,说明这套评测体系产生的结果相当稳定,不是"运气好就多几分、运气差就少几分"的随机现象。
在评分模型的选择上,研究团队对比了四种不同的大型语言模型作为裁判的效果。最终选定的是谷歌的Gemini 3 Flash——它在指令遵循、事实准确性和推理合理性三个维度的评分准确率分别达到了96.5%、94.2%和95.3%,同时每次评测的费用只有0.45美元,远低于其他候选模型,是准确率与经济性的最优平衡点。
归根结底,DailyReport揭示了一个颇为耐人寻味的现实:当前最顶尖的AI搜索系统,在理解你问什么上已经相当到位,但在给你的答案里,每说六件事就可能有一件是错的,而且就算它给你附上了来源链接,那个链接本身也未必可靠,即使可靠,它说的和链接里写的也可能对不上。这种"看起来专业、实则存疑"的特性,恰恰是普通用户最难以察觉、也最容易被误导的陷阱。
研究团队指出,未来的改进方向应该集中在两点:一是确保系统在生成答案之前进行足够充分的搜索;二是建立更严格的引用核查机制,确保每一个具体说法都能被可靠来源真实支撑,而不仅仅是"看起来有引用"。这两点听起来简单,但在技术上都需要突破性的进展。
对于普通用户来说,这项研究给出的最直接建议是:使用AI搜索助手时,对于具体的数字、排名、日期等事实性信息,务必自己多查一步,不要完全依赖AI的引用链接,因为那个链接本身可能就有问题,或者AI的总结与链接内容并不完全吻合。而在需要做出重要决策(比如选大学、投资、就医)时,AI搜索报告只应作为参考起点,而非最终依据。
有兴趣深入了解这套评测体系的读者,可以通过论文编号arXiv:2606.12871查阅完整论文,研究团队也已将数据集和代码开放在GitHub上,供研究者和开发者进一步探索。
Q&A
Q1:DailyReport评测基准与其他AI搜索评测工具有什么不同?
A:DailyReport最大的不同在于两点。第一,它的题目来源于微博、Reddit等平台上真实用户的日常热搜话题,而不是专家设计的专业问题,因此更贴近普通人的实际需求。第二,它采用"级联评分体系",把每道题拆成多个子任务,分别从指令遵循、事实准确性、推理合理性三个维度评分,并且三个维度之间存在依赖关系——如果连基本要求都没做到,后续维度的得分会直接清零,而不是简单相加掩盖错误。
Q2:现在最好的AI搜索助手事实准确性有多高?
A:根据DailyReport的测试,目前表现最好的系统是配备搜索工具的GPT 5.4,事实准确性得分约为0.835。这意味着它给出的具体事实信息中,大约有16%经不起核查。原生深度研究类智能体的表现则更低,部分系统的事实准确性仅在0.61左右,约每3个说法中就有1个存在问题。
Q3:用AI搜索助手查日常信息时需要注意什么?
A:需要特别注意具体的数字、排名、日期等事实性信息。DailyReport的研究发现,AI系统即使附上了引用链接,那个链接本身的内容也可能不准确,或者AI的总结与链接原文并不完全一致。因此,对于重要决策相关的信息,建议自行核查原始来源,不要仅凭AI生成的报告做判断。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。