微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当法律AI遇上"精准定位"难题:哥本哈根大学团队如何打造更真实的法律信息检索测试场

当法律AI遇上"精准定位"难题:哥本哈根大学团队如何打造更真实的法律信息检索测试场

2026-08-12 14:13
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-12 14:13 科技行者

这项由哥本哈根大学传播系与法学院联合开成的研究,于2026年8月发表在arXiv预印本平台,论文编号为arXiv:2608.03756v1。感兴趣的读者可以通过该编号在arXiv上查阅完整原文,数据集本身则托管在Hugging Face平台,DOI为10.57967/hf/9072。

**一、一个让法律工作者头疼的日常难题**

翻阅法律判决书是一件令人头皮发麻的工作。欧盟法院的一份判决书动辄数十页、上百个段落,而律师或法官真正需要的,往往只是某份老判决里的一两个关键段落——比如第29段说了什么原则,第20段确立了什么规则。这种"精准定位到段落"的引用方式,在法律界有个专门的名字叫做"pincite",也就是"精确引用"或"段落级引用"。

可以把这个过程理解为:你要在一座巨大的图书馆里找到某本书的某一页,而且你手里的线索只是一段模糊的描述,既没有书名,也没有页码。这正是法律信息检索系统(Legal IR System)每天需要面对的挑战。现有的AI检索系统已经能够帮助用户找到"相关的案件",但能否进一步精确到"相关案件里的哪个段落",则是一个更难的问题。

更麻烦的是,现有用来训练和测试这类AI系统的数据集,都存在一个根本性的缺陷——它们要么只能做到"找案件"这个粗粒度,要么虽然有段落级别的标注,却留下了严重的"作弊漏洞"。哥本哈根大学的研究团队正是为了解决这个问题,构建了一个名为LegalPincite的新数据集。

**二、现有数据集的两个"作弊漏洞"**

要理解这个研究的价值,先得搞清楚现有数据集的问题出在哪里。

第一个漏洞叫做"信息泄露"。现有的段落级法律检索数据集,在给AI系统出"考题"时,题目里往往包含了答案提示。具体来说,一个引用其他案件的段落,文本本身就会写明被引用案件的编号、当事方名称、甚至被引用的段落编号——比如"根据2019年比利时国家案,C-35/19号判决第29段的规定……"。如果拿这段原文去考AI,AI只要把段落编号"29"和案件编号"C-35/19"拿出来直接匹配,根本不需要真正理解法律内容,就能轻松找到"正确答案"。这就好比考试题目里已经把答案的关键词都写出来了,考生无需真正理解知识就能得高分,这样的成绩毫无意义。

第二个漏洞叫做"候选池过小"。现有数据集的文档库只包含"有被引用过的段落"和"有引用其他段落的段落",把那些既没有引用别人、也没有被别人引用的普通段落全都剔除了。然而在真实的法律判决书里,这些"普通段落"才是多数。一份判决书可能有100个段落,其中只有5个段落涉及引用,如果候选池里只有这5个,AI系统只需要在一个很小的范围内搜索,难度大大降低。这就好比在一个只有10个人的班级里找一个叫"小明"的同学,和在一所有3000名学生的学校里找同一个人,难度根本不是一个量级。

除了这两个根本性问题,研究团队在梳理现有数据集时还发现了大量数据质量问题:有段落的文本内容完全缺失,只剩一个编号;有些段落在解析时被错误地切割或合并;有些引用关系记录的段落编号根本不存在于被引用的案件里;还有约5%的段落混入了法语内容,没有任何语言标注,给后续处理造成麻烦。

**三、LegalPincite是怎么建起来的**

研究团队的工作可以理解为一次大规模的"数据整修工程",同时还扩建了新的内容。整个构建过程建立在两个现有数据集的基础上。

第一个基础是一个未公开发布的数据集,来自同一研究团队早期的工作,包含截至2024年7月的欧盟法院判决书中所有段落的文本和编号——不管这个段落有没有引用关系,都收录其中。这个数据集提供了后来LegalPincite里完整文档库的骨架。

第二个基础是一个已公开的数据集,包含截至2021年10月的判决书中11万余对引用关系(哪个段落引用了哪个段落),以及890条由两位法律专家手工标注的相关性判断。这部分数据构成了LegalPincite里检索任务的查询和标准答案。

在合并这两个数据集的过程中,研究团队逐一解决了前面提到的那些数据质量问题。对于文本缺失的段落,他们通过欧盟官方法律数据库EUR-Lex的Cellar API下载原始HTML文件来补全;对于段落切割错误的情况,他们重新从HTML源码中提取段落边界,因为判决书的原始代码里用自定义标签标注了每个段落的起止位置,可以作为可靠参照;对于人工标注数据格式混乱的问题,则完全手工整理,并通过文本精确匹配把每条标注重新关联到其对应的段落编号。

在修复旧数据的基础上,研究团队还在2026年5月补充收集了2021年至2025年间的新判决书数据,涵盖2170个新案件,新增了41547条引用关系。这部分新数据使得整个数据集的时间覆盖范围扩展到了2025年底。

**四、三种检索任务,一套数据集全覆盖**

LegalPincite设计的一个突出特点是同时支持三个层级的检索任务,这三个层级对应了法律实践中三种不同粒度的引用需求。

最粗粒度的是"案件对案件"检索:给定一份完整的判决书文本,要找出它所引用的所有其他案件。这类似于在图书馆里,你拿着一本书,要找出这本书的参考文献里涉及的所有其他书。

中间粒度是"段落对案件"检索:给定一个具体的判决段落,要找出这个段落所引用的是哪个案件。这相当于拿着一段摘抄,要找出这段摘抄来自哪本书。

最细粒度也是最难的是"段落对段落"检索,也就是pincite:给定一个引用其他判决的段落,要找出被引用的那个具体段落。这就好比拿着一段摘抄,不仅要找出来自哪本书,还要找到是书中的第几页、第几段。

数据集按照时间顺序分为训练集、验证集和测试集。训练集使用2018年之前的案件作为查询,验证集使用2018年到2021年间的案件,测试集使用2022年到2025年间的案件。对于验证集和测试集,候选文档库分别只包含早于所有查询案件的文档,这样可以避免"未来数据污染过去"的时间穿越问题——毕竟一个2020年的判决不可能引用一篇2023年的先例。

**五、如何堵住"作弊漏洞"**

针对信息泄露问题,研究团队采用了两步走的处理策略。

第一步是通过正则表达式(一种文本模式匹配技术,可以理解为一种精确的文字过滤器)识别并删除段落文本中出现的案件编号格式。欧盟法院的案件编号有固定格式,比如"C-35/19"或"EU:C:2019:894",这类格式可以用规则精确匹配并删除。

第二步是调用一个专门针对法律文本训练的命名实体识别模型,识别出段落中提到的当事方名称、法院名称等实体,并将其删除。因为这些信息同样可以帮助AI系统"猜到"被引用的案件是谁,而不需要真正理解法律内容。

研究团队在数据集中同时保留了"原始未处理"版本和"处理后屏蔽"版本的查询文本,这样使用者可以自己选择,也可以通过对比研究不同处理方式的效果。

**六、数据集里藏着哪些数字**

从数量上看,LegalPincite的规模相当可观。以测试集为例,段落对段落的检索任务有超过14000个查询,涉及超过23000条引用关系。候选文档库包含超过59万个段落,来自超过12000个案件,平均每个案件约有49个段落,平均每个段落约84个词。

研究团队还分析了查询文本与相关文档之间的词汇重叠程度和语义相似度。两项指标的中位数均低于0.5,也就是说大多数情况下,一个引用另一段落的段落,和被引用的段落之间并没有大量相同的词汇,语义上也不是简单的复述关系。这意味着仅靠关键词匹配或者简单的语义相似度计算,很难找到正确答案,系统需要真正理解法律逻辑才能做好这个任务。这从侧面说明这是一个真正有挑战性的测试场景,而不是一个可以轻松刷高分的简单题目。

在人工标注方面,验证集中有409条查询段落拥有额外的专家标注。专家标注的判断标准是:候选段落是否包含了引用段落所援引的规则——无论是逐字相同的版本,还是不同或扩展的版本。只有当两位专家都回答"是"时,这对关系才被标记为相关。

**七、用四种经典方法做了一次"摸底考试"**

为了给这个数据集建立一套基准性能参考,研究团队用四种经典的词袋检索方法进行了测试。这四种方法都属于基于词频统计的传统信息检索技术,不依赖深度学习,可以把它们理解为四种不同配方的"关键词匹配引擎"。

TF-IDF是最经典的一种,核心思路是:一个词在某个文档里出现得越频繁、在整个文档库里越罕见,它对于描述这个文档就越重要。BM25是TF-IDF的改进版,增加了对文档长度的惩罚机制,避免因为文档很长而人为抬高匹配分数。LMIR基于语言模型的思想,把文档看作生成词汇的概率分布,找到最有可能"生成"查询词的那个文档。DPH是一个不需要调参的模型,基于超几何分布理论,适合快速建立基线而不需要针对具体数据集进行调优。

测试结果显示,对于案件对案件的检索,LMIR表现最好,在测试集上NDCG@10(一种综合考虑检索准确性和排名质量的指标,满分为1)达到了0.442。对于段落对案件的检索,TF-IDF表现最好,NDCG@10达到0.604。对于最难的段落对段落检索,BM25和TF-IDF表现相当,NDCG@10约为0.555至0.557。BM25在案件和段落级任务上表现差异悬殊,研究团队认为这是因为BM25对超长文档有过度惩罚的倾向,而法律案件文本往往极长。

值得关注的是,即便是表现最好的检索方法,在最难的段落对段落任务上,NDCG@10也只在0.55左右,距离"完美检索"还有相当大的距离。这为未来更先进的方法提供了充足的提升空间。

**八、"作弊"到底能帮多大的忙**

研究团队专门做了一组对比实验,来量化"信息泄露"对检索性能的影响。他们在三种设置下分别测试了四个检索方法的表现:使用完全未处理的原始查询文本;只删除段落开头的段落编号;删除所有与引用相关的信息。

对于段落对段落检索,结果出人意料地清晰:完全删除引用信息之后,检索效果反而是最好的,比使用原始文本高出最多18.6个百分点(相对提升)。以LMIR为例,使用原始文本时NDCG@10只有0.429,而使用删除引用信息后的文本,这个分数上升到0.536。这个反直觉的结果,研究团队解释为:删除引用信息的同时也去掉了很多"噪声"——原本段落文本里出现的各种案件编号和人名,对于理解段落的核心法律内容没有帮助,反而会干扰检索模型的判断。

对于案件对案件和段落对案件的检索任务,使用原始文本或只删除段落编号的版本,确实会带来性能虚高的问题,提升幅度最高可达55%。这充分证明了此前数据集存在的信息泄露问题会让检索系统的评估结果严重失真。

只删除段落编号(而不删除其他引用信息)并不足以解决问题——在段落对段落任务上,这种处理方式比完全删除引用信息的版本性能低了最多34.7个百分点。由此可见,之前一些研究中"只删段落编号就算解决了泄露问题"的做法,实际上远远不够。

**九、这个数据集还能用来做什么**

研究团队在论文中指出,LegalPincite的用途并不局限于法律信息检索这一个领域。

由于欧盟法律文件本身是多语言的,这个数据集可以扩展用于跨语言检索研究——比如用英语的引用段落去检索法语的被引用段落。由于数据集中包含了引用段落和被引用段落,从中可以提取出"哪段文字引用了哪段法律规则"的关系,进而用于法律文本蕴含研究(判断一段文字是否支持或推翻另一段文字的结论)。欧盟法院的案件中有很多是成员国法院提交的初步裁定请求,附带了具体问题,研究团队认为可以将这些问题和对应的回答配对,用于训练和测试法律领域的检索增强生成系统,也就是让AI在回答法律问题之前先检索相关判决,再基于检索结果生成答案。此外,这个数据集也可以用来评估大型语言模型在法律推理方面的能力。

**十、诚实面对自身局限**

研究团队在论文中直接讨论了LegalPincite自身存在的若干局限性,这种坦诚值得记录。

关于"反馈循环"问题:数据集的引用关系主要来源于EUR-Lex,而EUR-Lex本身也是法律从业者常用的检索工具。这就产生了一个潜在的循环:如果法官在写判决时,是先用EUR-Lex检索到某个相关判决,然后才引用它,那么数据集里记录的引用关系,其实反映的是"EUR-Lex系统认为相关",而非"法律逻辑上真正相关"。研究团队注意到,查询段落和相关文档之间的词汇和语义重叠普遍较低,说明这个问题可能并不严重,但也无法完全排除。

关于专家标注的局限性:890条人工标注是由专家基于某个密集检索系统返回的前10个结果进行评判的,而不是对所有可能的相关段落进行穷举式标注。因此,数据集中可能存在真正相关但未被标注的段落。研究团队认为,这与法律实践中"引用少数关键先例即可"的习惯相符,因此建议在使用这个数据集评估检索系统时,重点关注精准度导向的指标(比如前3、前5个结果的命中率),而非召回率导向的指标。

关于引用信息屏蔽的不完整性:研究团队承认,自动化的信息屏蔽流程存在遗漏,通过人工抽查发现了若干未被成功删除的案件信息。但他们认为这些遗漏的数量不足以显著影响整体评估结果,系统性的审查工作留待未来研究。

---

说到底,法律信息检索这件事,表面看是技术问题,背后却是实实在在的法律实践需求。一个律师或法官如果能有一个工具,精准地帮他找到"某个法律原则最初是在哪份判决的哪个段落里确立的",那对于法律实践的效率和质量都有直接的影响。LegalPincite做的事情,是给未来想要开发这类工具的研究者,提供一个更真实、更严格的"考场"。以前的考场太容易,AI系统靠着题目里的作弊提示就能得高分;以前的考场太小,只有几道题,根本考不出真实水平。这个新数据集在规模、真实性和严格性上都前进了一步。

当然,即便是在这个更难的考场里,目前最好的检索方法也只能做到"大约六成的时候能在前10个结果里找到正确答案"——距离真正实用还有距离。这对于后来者来说,既是挑战,也是机会。

有兴趣深入了解技术细节的读者,可以在arXiv上通过编号arXiv:2608.03756v1查阅原论文,数据集本身可通过DOI 10.57967/hf/9072在Hugging Face平台访问,配套代码和使用示例则托管在GitHub上。

---

Q&A

Q1:LegalPincite数据集中的"段落级引用"和普通的"案件级引用"有什么区别?

A:案件级引用只告诉你"这个判决引用了哪个案件",而段落级引用(pincite)精确到"这个段落引用了那个案件里的第几段"。法律文件动辄上百段,案件级引用只能帮你找到书,段落级引用才能帮你翻到具体那一页。LegalPincite同时支持这两种粒度,以及介于两者之间的"段落对案件"检索,共三个层级。

Q2:LegalPincite数据集解决的"信息泄露"问题具体是怎么回事?

A:现有数据集在出检索"考题"时,查询文本里会直接包含被引用案件的编号和段落号,比如"根据C-35/19号判决第29段……"。AI系统只需提取这些编号直接匹配,根本不用理解法律内容就能得高分,导致评估结果严重虚高。LegalPincite通过规则匹配和命名实体识别,把这类信息从查询文本中删除,强迫系统真正理解内容才能找到答案。

Q3:LegalPincite数据集里的检索基准测试结果说明现有技术水平如何?

A:研究团队用四种经典词袋检索方法测试后发现,在最难的段落对段落检索任务上,最好的方法NDCG@10约为0.557,也就是综合排名质量约56%。简单说,大约六成情况下能在前10个结果里找到正确答案,但距离真正可靠的实用水平仍有差距,这为更先进的深度学习方法留下了充足的提升空间。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-