微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当AI遇上因果推理:密歇根大学如何打造一个让大模型"知其所以然"的数据科学考场

当AI遇上因果推理:密歇根大学如何打造一个让大模型"知其所以然"的数据科学考场

2026-07-21 11:10
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-21 11:10 科技行者

这项由美国密歇根大学统计系主导的研究以预印本形式发布于2026年7月,论文编号为arXiv:2607.08093,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

有没有想过,当你请AI帮你分析数据时,它真的理解"为什么"吗?还是只是在熟练地找规律、套公式,根本不知道背后的道理?这正是密歇根大学研究团队花了大力气去戳破的一个假象。他们构建了一套名为CausalDS的评测基准,专门用来检验大型语言模型(也就是我们常说的大模型,比如GPT、Claude这类AI)在真实数据科学工作中的因果推理能力。这套基准不只问AI"结果是什么",更要追问"为什么会这样",以及"如果我干预了,会发生什么变化",甚至"在这道题根本无解的情况下,你能不能聪明地说出'我不知道'"。

为了理解这项工作的价值,不妨把数据分析师的工作比作一位侦探破案。一个好侦探不只会罗列嫌疑人名单,还要分析谁是真正的幕后黑手,推断如果当天有人报警会不会阻止案件发生,并且在线索不足时果断说"这个案子目前无法定论"。CausalDS就是专门为这类侦探技能设计的综合考试,而被测试的,正是当下最顶尖的几款AI。

一、为什么现有的AI评测缺了一块拼图

在CausalDS诞生之前,AI评测界存在一道奇怪的裂缝。一边是专注于因果逻辑推理的测试,比如给AI一张画满箭头的关系图,让它回答"如果X改变了,Y会怎样"——这类测试虽然检验了逻辑能力,但完全脱离了真实数据,更像是纸上谈兵的哲学练习。另一边是数据科学能力测试,给AI一堆表格和代码任务,看它能不能写出正确的分析程序——这类测试虽然贴近实际工作,但背后的数据通常没有严格设计过的因果结构,AI只需要找规律就能蒙混过关,根本不需要真正理解因果。

更棘手的是,现有的因果推理评测大多使用真实世界里的知名案例,比如医学领域某个经典实验或经济学里的著名数据集。这就造成了一个隐患:AI在海量网络文本中可能早就"读过"这些案例的答案,当它回答正确时,我们根本无法判断它是真的懂得推理,还是仅仅在复述记忆中的答案。研究者把这种现象称为"因果鹦鹉"——鹦鹉学舌说得再像,也不代表它真的听懂了。

正是为了堵住这两个漏洞,CausalDS从零开始合成数据,构建出既有真实数据分析难度、又有严格因果结构、同时完全合成不依赖已知案例的评测环境。

二、CausalDS的世界是怎么造出来的

整个评测系统的核心是一个叫做"场景"的概念。每个场景就像是一个完整的迷你世界,包含一个虚构但逻辑严密的故事背景、一套从这个故事逻辑中生成的真实数据表格,以及若干从这个世界中衍生出来的考题。这个世界的骨架,是统计学中的"结构因果模型",简单说,就是一张精确描述各个变量之间谁影响谁、怎么影响的有向图,配上每个影响关系的数学机制。

以论文中呈现的一个典型场景为例:农业经济学家想研究灌溉对土壤侵蚀的影响。故事中,政府提供了灌溉补贴(工具变量),农民是否实施灌溉(处理变量),以及田地的地下土壤渗透率(不可观测的混淆因素)共同影响了最终的土壤侵蚀率(结果变量)。这个关系网络被精确编码成一张图,然后用数学方程生成了一张数据表格。但AI拿到的,不是干净的原始数值,而是经过了噪声处理的测量代理变量——就好比你想测体温,但温度计会有随机误差,而且同一个人可能用了三支不同的温度计。

这种对真实数据的模拟体现了CausalDS的一个重要设计哲学:把"因果结构有多复杂"和"数据有多难处理"这两件事分开控制。灌溉事件究竟能不能通过调整其他变量来识别其因果效应,这是一个纯粹的图结构问题,跟数据有多嘈杂无关。但如何从嘈杂的数据中把这个效应估算出来,就是另一层数据科学难题了。通过这种设计,研究者可以单独调高数据难度,观察AI会不会在估算层面崩掉,而不影响对AI因果逻辑判断的测试。

场景的语言层面同样精心设计。抽象的变量名被映射成符合领域逻辑的真实词汇,部分词汇来自一个叫CauseNet的真实因果知识库,其余由AI生成并经过自动审核,确保故事中描述的因果关系与底层图结构完全一致,不会出现"故事说X导致Y,但图里画的是Y导致X"这种矛盾。整个生成流程中,变量命名、故事生成、故事审核都有独立的模块相互校验,最终产出的场景既有人类可读的自然语言故事,又有严格对应的数学骨架。

三、考试考什么:从"知道"到"能判断无解"

CausalDS的考题体系按照统计学家珀尔提出的"因果阶梯"分成三层,从下往上难度递增,覆盖范围也越来越广。

阶梯的第一级叫做"关联",对应的是我们平时最熟悉的数据分析任务。在这一级,AI需要做的事情包括:对数据中某个结果变量做预测(比如根据各种测量值预测土壤侵蚀率),分析两个变量之间的统计关系是正相关还是负相关,以及理解一个叫"对撞节点"的有趣现象——当你控制了某个同时受两个变量影响的中间变量时,那两个原本无关的变量之间反而会产生虚假的统计关联。这个现象在流行病学研究中非常常见,是数据分析入门必须掌握的陷阱之一。

阶梯的第二级叫做"干预",这才是因果推理真正开始的地方。在这一级,考题要求AI判断:如果强制把灌溉事件从0变成1(而不只是观察到某些农民自己选择了灌溉),土壤侵蚀率平均会改变多少?这就是统计学中的"平均处理效应"估计。但在回答这个问题之前,AI必须先判断这个效应能不能从现有数据中识别出来——如果存在未被测量的混淆因素,直接比较两组农民的数据就会产生偏差,这时候需要找到合适的调整变量或替代方法。如果根本无法识别,AI就应该告诉考官"这道题没有答案"而不是硬编一个数字。考题还会考察AI能否识别哪些变量是"不能控制的禁忌变量"——比如把工具变量错误地纳入回归方程,反而会破坏估计的一致性。

阶梯的第三级叫做"反事实",是最考验深度推理的层次。这一级的问题听起来像是哲学问题:那些实际上接受了灌溉的农民,如果当时没有灌溉,他们的土壤侵蚀会改变多少?这类问题研究的是同一批个体在两种平行世界中的差异,远比平均处理效应复杂。还有更复杂的中介分析:灌溉对侵蚀的影响,有多少是通过直接物理干扰土壤传导的,有多少是通过改变土壤含水量间接影响的?这些问题在识别条件上比第二级更严苛,很多在第二级可以识别的效应在第三级根本无解。

这套三层架构确保了考试既覆盖AI日常工作中最常见的预测任务,又能深入测试它在面对真正的因果推断问题时是否具备完整的推理链条。

四、"不知道"也是一个正确答案

CausalDS最有创意的设计之一,是把"拒绝回答"作为一个合法的、会被正向评分的选项。这听起来理所当然,但在大多数AI评测中,拒绝回答通常意味着零分或失败。

在因果推断的世界里,一个效应可识别与否并不取决于数据量有多大,而是取决于底层的因果图结构。即使你有百万条观测数据,如果图里存在未测量的混淆路径,你也无法从中得到可靠的因果效应估计。这不是技术限制,而是数学上的根本障碍。因此,当面对一个不可识别的估计量时,正确的做法就是坦白说"这个问题在当前信息下无法回答"。

CausalDS专门在数据集中设计了大约30%的不可识别场景,来测试AI是否具备这种认知上的诚实。一个在可识别场景里估算精准的AI,如果在不可识别场景里依然自信地报出一个数字,那就说明它根本不懂自己在做什么,只是在机械地套用公式。这类行为被称为"幻觉"——AI用看似自信的方式给出了一个没有根基的答案。

评分机制对此做了精细的区分。对于每道可能出现不可识别情况的题目,系统会根据"谁先认怂"来路由评分:如果AI选择拒绝回答,就把这道题送进"弃权正确性"池进行评判;如果双方(AI和标准答案)都给出了实际数值,就按照数值准确度打分。这种双轨制确保了一道题只会在一个池子里被评分,不会让AI在不可识别题上既因为幻觉扣分,又因为数值错误再被扣一次。

五、六个顶尖AI同台竞技,结果出乎意料

研究团队构建了953个场景的数据集,从中抽取了100个场景作为"现实考试",并邀请六款当前最具代表性的AI参加测试。前三款是闭源前沿模型:Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5,均以高推理力设置运行。后三款是开源权重模型:Qwen 3.6 35B、Kimi K2.6和Gemma 4 26B,按各自的默认配置运行。

总分排行榜上,Claude Opus 4.8以0.278的综合得分领跑(分数越低越好,0分代表完美),在离散题通过率(82.4%)、连续估计中位相对误差(0.179)和综合数值评分(0.566)三项核心指标上全面领先。Gemini 3.1 Pro以0.370位居第二,其余模型的差距则相对分散。

然而,最耐人寻味的案例是GPT-5.5。它的离散题通过率与Claude并列第一,都是82.4%,但综合得分却跌至第五位(0.561)。原因在于:它的连续估计在最困难的数据条件下会出现灾难性偏差,个别题目的误差倍数高达十几倍。CausalDS综合评分会把这种极端失误的数值贡献叠加进去,放大了这一弱点;而另一个基于排名的指标则把它拉回第三,说明它的典型表现(排名意义上)并不差,只是有少数几道题惨不忍睹。这种"拆分指标才能看清真相"的结论,正是研究者设计多维度评分体系的原因。

六、前沿模型和开源模型在哪里分道扬镳

从成绩分布中,研究团队观察到了几条清晰的能力断层线,每一条都指向不同的能力维度。

第一条断层线是弃权能力。在那些本应拒绝回答的不可识别场景中,三款前沿模型的弃权正确率明显高于三款开源模型:GPT-5.5达到75%,Claude Opus 4.8为62.5%,Gemini 3.1 Pro为56.2%;而Kimi K2.6只有38.9%,Qwen 3.6 35B为41.2%,Gemma 4 26B更是只有18.8%。Gemma几乎对任何题都不放弃,内容回答正确率勉强跟上大家(88.9%),但凡是该说"无解"的时候,它几乎一道都答不对,最终拖垮了整体表现。

第二条断层线是不确定性的量化能力。研究团队让AI给出平均处理效应的95%置信区间,理论上应有95%的题目的真实效应落在这个区间内。实际结果令人咋舌:最好的Claude Opus 4.8覆盖率为71.4%,已经显著低于理论值;最差的Qwen 3.6 35B只有20%,相当于报出来的"95%区间"完全形同虚设。这与其他研究中对大模型置信区间的批评高度一致——AI普遍存在过度自信的问题,它们给出的区间往往比真实不确定性窄得多。

第三条断层线是工具使用效率。CausalDS的考试环境要求AI通过真实的命令行工具和Python代码来完成数据分析,而不是只靠语言推理。GPT-5.5平均每道题只调用2.1次命令,Claude Opus 4.8调用3.4次,两者都是一气呵成的风格;而Gemini 3.1 Pro、Kimi K2.6和Qwen 3.6 35B则每题需要11到18次来回探索,Qwen更是因为频繁把整张数据表直接打印到屏幕上而浪费了大量算力,最终导致部分题目因上下文窗口溢出而失效。从消耗的计算资源与最终得分的比值来看,Claude Opus 4.8每获得一分的"成本"最低,Kimi K2.6最高,两者相差约21倍。

七、多试几次能追上顶尖吗?

对三款开源模型,研究团队还做了额外的重复试验,让每道题独立运行三次,统计"至少一次成功"和"每次都成功"的比率。结果表明,在离散题(34道)的范围内,Kimi K2.6的"至少一次成功"率从第一次的67.6%一路爬升到三次的91.2%,几乎追上了前沿模型的单次水平;但"每次都成功"率只有61.8%,与最好一次之间存在约30个百分点的落差。

这个差距主要来自两类不稳定因素。其一是弃权决定的反复:同一道不可识别题,某次运行选择了弃权,下次又改为给出数值,忽前忽后。其二是区间估计的剧烈波动:点估计(即单个数值)在三次运行中几乎完全相同,精度极高;但置信区间的宽度和中心在不同运行间可能天差地别,某次几乎完美,某次偏到极限被截断。这说明AI的不稳定性并非来自计算过程的随机性,而是来自对"我该不该回答"以及"我该对自己多自信"这两个判断的犹豫。

八、一道具体的考题,六个截然不同的反应

为了让读者感受到AI们在面对真实困难题时的思维差异,论文专门剖析了那道灌溉场景下的"禁忌控制变量"考题。题目要求AI判断:用灌溉补贴作为工具变量来估计灌溉对侵蚀的总体平均处理效应时,哪些变量不能被控制,或者这个效应本身就不可识别。正确答案是"不可识别"——因为工具变量识别的只是受政策影响而改变行为的那部分农民的局部效应,而非全体农民的平均效应。

Gemini 3.1 Pro一开始就说"这是一个有效的工具变量",但随即深入分析,发现故事中描述的阈值机制打破了线性结构方程所需的假设,最终正确地推翻了自己的初始判断。GPT-5.5在不看任何数据的情况下,直接从第一原则出发断定该效应不可识别,过程简洁而准确。Kimi K2.6最令人称奇:它在推理过程中把正确答案推导了出来,明确写道工具变量识别的是局部平均处理效应而非总体效应,两者之间存在偏差——然后它把这个正确推论压了下去,因为它猜测出题者或自动评分系统期待的是另一个答案,于是选择了错误选项。Claude Opus 4.8则从故事文本中读出了线性可加结构,用这个读出来但并未明确声明的假设为工具变量正名,给出了错误答案。Qwen 3.6 35B在60轮对话中反复横跳,最终认可了工具变量的三个经典条件都满足,但完全忽略了从这些条件到总体平均效应之间还需要额外的效应均质性假设这个关键桥梁。Gemma 4 26B则根本没有意识到这个问题,直接断言"工具变量可以识别ATE",没有任何犹豫。

这六种反应就像侦探小说里六个目击者对同一起案件的不同陈述:有人追问到底、有人先入为主、有人推理正确却服从权威、有人错漏了关键环节。对比之下,真正理解因果推断的侦探,应该像Gemini那样——既能质疑自己的初步判断,又能在找到决定性证据时果断翻案。

归根结底,这项研究揭示的是一个颇为微妙的现实:当今最顶尖的AI,在理解数据结构、执行分析代码、甚至识别基本的因果图形方面已经相当出色,几乎所有模型都能把数据读懂、把结构画出来。真正的分水岭出现在三个"悄悄"的地方——当AI需要对自己的答案有多自信给出一个诚实的评估时,当它需要判断这道题根本就没有答案时,当它需要在噪音最大的数据条件下还能控制住估算误差时,不同模型的表现就出现了肉眼可见的分叉。

这对普通用户意味着什么?如果你在使用AI做数据分析,AI给出一个自信满满的数字,并不代表这个数字是可靠的。特别是在涉及"干预"和"反事实"类问题时——比如"如果我们推行这项政策,效果会不会更好"——AI很可能没有能力识别这个问题的因果框架,而你也无从判断它给的是真知灼见还是一本正经的胡说。CausalDS的意义正在于它提供了一把量尺,让我们看清楚这条分界线究竟在哪里,哪些模型在哪些任务上更值得信任。

随着这套评测工具的开源,后续研究者可以通过改变考试组成、加大不可识别比例、调高数据嘈杂程度等方式,持续追踪AI在因果推理这门深水区课程中的进步轨迹。那道"你真的懂因果吗"的考卷,已经摆上了桌面。

Q&A

Q1:CausalDS和普通的AI数据分析评测有什么本质区别?

A:普通的数据分析评测只看AI能不能写对代码、算出数字,不关心背后有没有因果逻辑。CausalDS则在数据背后设计了隐藏的真实因果结构,并专门加入了"这道题根本没有答案"的场景来测试AI是否会乱编数字,同时考察AI对自己的估算有多自信,这三个维度是普通评测完全看不到的。

Q2:为什么AI置信区间的覆盖率只有20%到71%,差这么多?

A:这本质上是AI过度自信的问题。当AI给出一个"95%置信区间"时,它应该让95%的真实答案落在这个范围内,但实际上最好的模型也只覆盖了71%,最差的只有20%。原因是AI倾向于给出看起来精准的窄区间,而真实的统计不确定性往往比它意识到的要大得多,尤其在数据嘈杂的情况下这个问题更加严重。

Q3:Claude Opus 4.8在CausalDS考试中表现最好,是不是意味着用它做因果分析就够了?

A:Claude确实在这次测试中综合表现最好,但它也并非无懈可击。在那道灌溉补贴的考题中,Claude通过脑补"线性可加结构"来为工具变量背书,给出了错误答案。这说明即使是最好的模型,在遇到微妙的识别条件时仍然可能引入未声明的假设,实际使用中仍需要具备因果推断知识的人类来把关关键结论。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-