微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当AI律师开始"瞎编"合同条款,我们该怎么办?——独立研究者揭示法律AI的致命盲区

当AI律师开始"瞎编"合同条款,我们该怎么办?——独立研究者揭示法律AI的致命盲区

2026-06-24 12:16
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-24 12:16 科技行者

这项由来自加利福尼亚州桑尼维尔和圣地亚哥的两位独立研究者完成的研究,发表于2026年ICML(国际机器学习大会)旗下的"野外智能体:安全、安保与未来"第二届研讨会(AIWILD @ ICML 2026),论文预印本编号为arXiv:2606.18021,于2026年6月16日公开。有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

假设你是一家公司的法务负责人,你刚刚用了一款AI工具来审查一份重要合同。AI自信满满地告诉你:合同里有一条规定,对方的赔偿责任最高不超过500万美元。于是你放心地签了字。几个月后,纠纷真的发生了,律师翻遍合同,那个500万上限根本不存在——是AI凭空捏造的。损失可能是几千万,甚至公司的存亡。

这不是科幻故事,这正是今天法律AI领域正在发生的真实风险。两位独立研究者为此开发了一套名为LegalHalluLens(法律幻觉透镜)的审计框架,专门用来拆解AI在法律文件中"说谎"的方式、位置和方向,并给出了一套经过验证的修正方案。

一、AI律师的谎言:不是一种,而是四种

当我们说AI在"幻觉"(hallucination),通俗来说就是AI在一本正经地胡说八道——它把自己编造的内容当成真实信息输出给你。在法律合同审查这件事上,这种问题尤为危险,因为合同里每一个字都可能价值连城。

这项研究把合同中的内容按照"容易出错的方式"分成了四大类。第一类叫做数字类,指的是合同里的金额、比例、数量上限这些东西,比如赔偿上限是多少钱、最低采购量是多少件。第二类叫做时间类,指的是日期、期限、通知周期,比如合同什么时候到期、续约需要提前多少天通知。第三类是义务与权利类,这类是最复杂的,因为它包含了"应当""可以""必须"这些表达强制程度的词,还有各种例外条款、附加条件和范围限定,比如"供应商须在产品制造前的有效期内,对第三方索赔提供赔偿,但第4.2条规定的情况除外"。第四类是事实类,指的是当事方名称、适用法律、合同名称这些基础信息,看起来简单,但AI有时会把常见的"默认法律"强行套进去。

研究团队选择了一个叫做CUAD(合同理解分析数据集)的标准测试库作为"考场"。这个数据集由法律专家精心标注,包含510份真实商业合同,覆盖41种具体条款类型,相当于给AI准备了一份有标准答案的法律试卷。整个研究共产生了249,252条条款级别的判定数据,规模相当庞大。

二、平均分的骗局:一个52%背后藏着的惊天落差

研究团队测试了四款主流AI模型,分别是两款商业API(谷歌的gemini-3-flash和OpenAI的gpt-5.2),以及两款开源模型(拥有328亿参数的qwen3-32b和拥有700亿参数的llama-3.3-70b)。每款模型在所有510份合同上跑了三轮,确保结果稳定可靠。

汇总结果出来之后,表面上看起来没什么大问题:四款模型的整体"内容幻觉率"(也就是AI找到了条款,但说的内容和原文对不上的比例)集中在50.9%到56.5%之间。换句话说,大家都差不多,都在52%左右。如果你只看这个数字,你会觉得这四款工具半斤八两,没什么好比的。

但当研究者把这52%按照上面那四种类型拆开来看时,画风突变。在义务与权利类条款上,四款模型的幻觉率都在64.8%到73.6%之间;在数字类条款上,幻觉率在66.8%到74.3%之间。而在时间类条款上,幻觉率仅为29.0%到35.1%。

这意味着什么?同一个AI模型,处理时间类条款时,大概每三次才错一次;但处理数字类和义务类条款时,几乎每四次就要错三次。两者之间的差距高达38到41个百分点。用一个比喻来说:这就好像一个学生数学考了90分,语文考了50分,但你只知道他的平均分是70分——你以为他是个中等生,实际上他的数学非常好,语文却岌岌可危。而在合同审查这件事上,出问题最多的义务类和数字类条款,恰恰是决定赔偿上限、合同义务范围、法律效力的最关键条款。

这个发现被研究者称为"类型化失败排序",而且这个排序在所有四款模型上都完全一致,没有任何例外:数字类和义务类排名最差,其次是事实类,时间类表现最好。这种跨模型的一致性意味着这不是某个模型的个别问题,而是当前这代AI系统在法律理解上的结构性弱点。

研究者还特别指出了一个令人不安的细节:他们在给AI的提示词里,专门对数字类条款写了明确的排除说明,比如告诉AI"仅排除某类损害赔偿而不设定最高金额上限的条款,不算赔偿上限条款"。然而数字类条款的幻觉率依然高居前两位。这说明AI的"训练记忆"(也就是它从大量文本中学到的"常见默认值",比如"赔偿上限通常是500万或1000万美元")会在处理具体合同时悄悄覆盖掉明确的指令,这是提示词工程(通过调整给AI的指令来改善输出)无法完全解决的深层问题。

三、不只是错了,还要看往哪个方向错

研究的下一个问题更加微妙,也更加重要:AI犯错的时候,是倾向于"漏说"(把合同里有的条件悄悄丢掉)还是倾向于"乱加"(把合同里没有的条件凭空加进去)?

这两种错误看起来差不多,但法律后果天差地别。假设合同里规定了"供应商须赔偿第三方索赔,但由买方过失导致的情形除外"。如果AI漏掉了"买方过失除外"这个条件,那合同看起来供应商要承担所有情况的赔偿,范围被无限扩大;而如果合同里根本没有赔偿上限,但AI凭空加了一个"赔偿上限为500万美元",那审阅者就会以为有保护,结果没有。前者让义务看起来比实际更重,后者让风险看起来比实际更小。两种错误都能导致真实的法律损失,但它们需要的补救措施完全不同。

为了把这种方向性差异变成一个可以直接拿来比较不同AI系统的数字,研究团队发明了一个叫做"风险方向指数"(RDI,Risk Direction Index)的指标。它的计算方式非常直接:用"多加条件"(AI发明了合同里没有的条件)的比例,减去"少说条件"(AI漏掉了合同里有的条件)的比例,再除以100,得到一个正负号清晰的数字。正数代表AI倾向于发明内容,负数代表AI倾向于遗漏内容。

测试结果在这里展现出了惊人的分化。gpt-5.2的RDI是+0.161,这意味着它更倾向于多说、多加、偏向"发明"错误。qwen3-32b的RDI是-0.202,意味着它更倾向于少说、漏掉,偏向"遗漏"错误。这两个模型的整体幻觉率几乎完全相同,都在52%左右,但它们犯错的方向完全相反。

研究团队还对这个RDI数字做了统计上的可靠性验证,通过2000次重采样计算出置信区间,确认gpt-5.2的[+0.151, +0.170]和qwen3-32b的[-0.212, -0.193]两个区间完全不重叠。这说明这种方向上的差异是稳定存在的,不是偶然的运气问题。

这对实际使用有什么意义?当一家公司主要在用AI做合规监控,帮助确认对方是否履行了所有义务时,他们最怕的是AI漏掉了义务条款——明明合同里写了对方要做什么,AI却没检测出来。这时候选一个RDI为正或接近零的系统(比如gpt-5.2)更安全,因为它犯的错误是"多说",至少那些它认为存在的义务是真实存在的。而如果一家公司主要用AI来批量过滤合同、快速识别高风险条款,假阳性(AI把没有的东西当有)会浪费大量人工复审资源,这时候可能更倾向于选一个RDI偏负的系统。没有哪个模型是绝对好的,关键在于你的业务场景是什么。这正是RDI这个指标设计的价值所在:让原本无法比较的"同样52%"变成了可以根据实际需求做出选择的决策依据。

四、给AI配上六人辩论团,错误下降45%

知道了AI在哪里出错、往哪个方向出错,下一步就是能不能修好。研究团队设计了一套叫做"类型化辩论流水线"(Typed Debate Pipeline)的多智能体系统,思路是让多个AI角色互相质疑、核实、仲裁,最终给出一个比单打独斗更可靠的答案。

整个流水线由六个AI角色组成,每个角色都有明确分工。第一个角色叫做怀疑者,它的工作是专门针对最容易出错的那些类型,发出精准的挑战性问题。对于数字类条款,怀疑者会问:这个数字是在合同原文里白纸黑字写着的,还是AI根据行业常见值猜出来的?单位是明确的吗?对于义务类条款,怀疑者会问:那个表示强制程度的动词("应当"还是"可以")原文是怎么写的?所有触发条件都捕捉到了吗?有没有漏掉任何"除……情形外"这样的例外?这些挑战问题不是随机生成的,而是根据第一轮实验测量出来的具体失败模式量身定制的。

第二个角色是支持者,它的任务是防守,通过从合同原文中逐字引用来支持AI最初的提取结果。第三个角色叫做再提取者,当怀疑者发现AI提取的根本是错误的条款(不只是条款内容有偏差,而是找错了地方),流水线就不再争论这个错误答案,而是重新从合同原文里提取一次,避免在错误基础上继续辩论。第四个角色是仲裁者,当怀疑者和支持者经过两轮辩论仍然僵持不下时,仲裁者介入做出保守决定,倾向于维持原始提取结果,除非有压倒性证据证明需要改变。第五个角色是核实者,它独立搜索合同文本,不依赖辩论双方的任何观点,单独确认某个条款是否真实存在、其定义是否符合要求。第六个角色是法官,它读完整个辩论记录、核实者的报告和仲裁者的意见,做出最终决定,同时执行两个非对称的安全门。

这两个安全门是整个系统中非常精妙的设计。增加门(absent to present)负责处理"AI新发现了一个之前没发现的条款"的情况,它要求核实者和辩论双方同时同意才能通过,门槛极高,防止凭空捏造。删除门(present to absent)负责处理"把原来发现的条款删掉"的情况,一旦核实者确认这个条款确实存在于合同中,删除门就会被锁死,防止正确的发现被过度保守地抹掉。这种不对称的设计来自第一轮实验测量出的FAR(误报率)大于FRR(漏报率)的现实,用系统性的门控机制来纠正AI的天生偏向。

测试这套流水线时,研究者用的是一款叫做gemma-4-26B-A4B的开源模型,它是一种混合专家架构,虽然总参数量是260亿,但每次推理实际激活的只有40亿,成本非常低。而且这个模型在第一轮实验中没有参与基准测试,保证了第二轮实验的独立性。更重要的是,在120份合同的测试子集上,这个模型的基础版本(不加辩论)在所有对比系统中排名垫底,任何提升都能明确归因于辩论流水线的效果,而不是底座模型本身就强。

结果相当清晰。加了辩论流水线之后,误报提取(AI说有这个条款但实际上没有)的数量从524条降到了287条,降幅达到了45%。这对实际使用意义重大:减少了近一半的"幻觉条款",意味着法务人员不需要再花大量时间核查那些根本不存在的条款。

而且降幅的分布与第一轮实验的预测完全吻合。义务类条款的误报率降幅最大(降了8.2个百分点),事实类次之(降了5.8个百分点),数字类和时间类降幅较小(分别降了3.6和2.4个百分点)。时间类条款本来就是所有类型中幻觉率最低的,怀疑者对它的挑战效果自然也最有限。这种预测与实测的吻合,证明了第一轮实验测量出来的失败模式诊断是有实际价值的,不只是好看的数字。

在义务类条款的错误方向上,辩论流水线也带来了显著修正。加辩论之前,这个模型在义务类条款上的RDI是-0.078,偏向于遗漏条件;加辩论之后,RDI变成了-0.014,几乎趋于平衡。怀疑者针对遗漏条件和例外条款的精准追问,确实把AI从"少说"的偏向中拉了回来。

在综合排名上,加了辩论流水线的gemma-4-26B-A4B(综合得分2.4分,越低越好)超过了商业API gpt-5.2(综合得分2.6分),在五种不同的权重方案中,有四种方案下排名第一,只有在偏重召回率(强调不漏掉条款)的方案下,gpt-5.2排名第一。这意味着一个激活参数量只有40亿的小模型,通过设计精良的辩论架构,达到甚至超过了大型商业模型的水平,同时推理成本大幅降低。

五、这套框架对实际部署意味着什么

研究者在讨论这些发现对现实世界的影响时,给出了几条具体的行动建议,这些建议对任何正在使用或考虑使用法律AI工具的机构都有参考价值。

任何只报告总体准确率的法律AI评估,都无法真正支撑部署决策。一个报告说"准确率88%"的系统,可能在赔偿上限、义务范围这些最关键的条款上,错误率高达65%以上。采购时必须要求按条款类型分开报告的测试数据,而不是一个平均数。

RDI这个方向指标让原本无法直接比较的不同系统变得可比。在选择系统时,应当根据实际业务场景中"漏报"和"误报"哪种代价更高,来决定倾向于选择哪个方向的RDI。合规监控场景下,漏掉义务比多报一条不存在的义务代价更高,应选RDI偏正的系统;批量文件初筛场景下,误报消耗大量人工复审资源,应选RDI偏负的系统。

这套审计框架本身是通用的。研究者明确指出,他们测量出的具体数字只适用于510份英美商业合同,其他法律管辖区、其他文件类型的情况需要重新测量。但是这套框架的方法论本身——四类条款分类、RDI计算、辩论流水线校准——可以迁移到任何有可验证标准答案的法律提取任务上。

即便是最好的系统,在检测出的条款内容上仍然有58.6%的错误率。这意味着AI辅助法律工作应当是"辅助"而非"替代"——法律AI工具应当用来帮助人工筛选和聚焦注意力,而不是直接输出最终法律判断。研究者明确建议:不应自主部署而不加人工审核,尤其对义务类和数字类条款,必须保留人工复核环节,并明确告知使用方,整体准确率不能代表法律风险的上限。

此外,研究者还提出了一个值得警惕的双重使用风险:设计精良的多智能体提取流水线,可能会被用来伪造"合规审查的外观",也就是输出一份看起来经过仔细审查的报告,但实际上仍然掩盖了那40个百分点的类型化差距。对此他们建议,在每次实际部署前都应该针对代表性文档重新测量类型化失败率,而不是依赖供应商报告的汇总准确率。

说到底,这项研究揭示的核心矛盾在于:法律AI领域长期以来用来衡量系统好坏的那把尺子——整体准确率——实际上丈量的是一个错误的维度。一把只会测量长度的尺子,无法告诉你一个物体有多重;一个只会汇报平均幻觉率的指标,无法告诉你某个系统在你最在乎的那类条款上会犯什么错、往哪个方向犯错。

这就是LegalHalluLens这套框架真正想做的事:不是告诉你哪个AI更好,而是给你提供一套工具,让你能够根据自己的业务场景、风险承受能力和法律责任,做出真正有据可依的选择。它把一个模糊的"52%",拆解成了一张可以对照使用场景逐条检验的诊断报告。

对任何正在考虑在法律流程中引入AI的团队来说,这里有几个值得持续追问的问题:你们的系统有没有提供按条款类型分类的幻觉率报告?你们了解这个系统的错误是偏向遗漏还是偏向发明?你们的义务类和数字类条款有没有人工复核机制?这些问题的答案,可能比AI供应商的任何演示报告都更接近真实的法律风险所在。有兴趣深入了解这套框架的完整技术细节,可以通过arXiv:2606.18021找到原始论文。

Q&A

Q1:法律AI的"幻觉率"(hallucination rate)是什么意思,52%代表什么?

A:幻觉率指AI把错误或虚假内容当成真实信息输出的比例。52%的幻觉率意味着AI在找到合同条款之后,大约有一半的概率给出的内容和合同原文对不上,可能是金额错误、条件遗漏或者凭空添加了不存在的内容。但研究发现,这个平均数掩盖了巨大差异:关键的义务类和数字类条款错误率高达65%到74%,而时间类条款只有29%到35%。

Q2:风险方向指数(RDI)对选择法律AI工具有什么实际帮助?

A:RDI告诉你一个AI系统犯错时更倾向于"多加不存在的内容"还是"漏掉存在的内容"。如果你的业务场景主要是合规监控,最怕漏掉合同义务,应选RDI为正数的系统;如果主要做大批量初筛,误报太多会浪费人力,应选RDI为负数的系统。两款幻觉率完全相同的系统,RDI可能截然相反,适合的场景也完全不同。

Q3:LegalHalluLens辩论流水线是怎么做到让小模型超过大型商业AI的?

A:辩论流水线让六个AI角色分工协作:怀疑者专门针对最容易出错的条款类型提出精准质疑,核实者独立从合同原文查证,增加门和删除门用不对称的严格程度防止凭空添加条款。这种设计把错误率最高的义务类条款的误报降低了8.2个百分点,整体误报下降45%,让一个激活参数仅40亿的小模型在综合评分上超过了商业大模型。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-