
这项由新西伯利亚国立大学团队完成的研究,发表于2026年SemEval研讨会(第20届语义评测国际研讨会)第8号任务"MTRAGEval:多轮检索增强对话评测",论文编号为arXiv:2605.04523v1,发布于2026年5月6日。
当你向客服机器人连续追问好几个问题,却发现它每次都"忘记"了之前说过什么,或者信口胡诌一些根本不存在的内容——这种体验大概算得上是现代人对AI最深切的失望之一。这项研究瞄准的,正是这个让无数用户抓狂的问题:如何让AI在多轮对话中,既能记住之前的对话内容,又能严格根据给定的参考文件来回答,而不是靠"直觉"瞎猜?
研究团队在这次竞赛中面临的挑战叫做"Task B"——系统会拿到一段多轮对话的历史记录和一批参考文件,然后必须根据这些材料生成最终一轮的回答。507道考题,四个不同领域,涵盖金融、云计算、法律文件等场景,其中有些问题压根儿就无法从文件中找到答案,有些问题则含混不清需要反问,还有些问题只能部分回答。这就好像让一个应聘者参加一场既要博学又要诚实的综合面试,稍有过度发挥或答非所问就会扣分。
面对这样的挑战,新西伯利亚国立大学团队的策略可以用一句话概括:不押宝一个天才,而是组建一支风格各异的梦之队,再找一个眼光毒辣的评委从中挑出最佳答案。他们最终以综合得分0.7827夺得26支参赛队伍中的第一名,将第二名的最强基线系统(gpt-oss-120b,得分0.6390)远远甩在身后,领先幅度超过22%。
一、为什么一个天才不如七个普通选手?
理解这项研究的核心思路,可以用一个招聘面试的比喻来入手。假设你要给一家公司挑选客服人员,手边有七位候选人。有人擅长严谨的合同条款解读,有人对"我不知道"说得毫不含糊,有人善于用简单话解释复杂概念,有人则在多步骤问题上反应敏捷。如果你每次都只派其中一个人上岗,难免遇到不擅长的问题就卡壳;但如果七个人都回答同一个问题,再由一位经验丰富的主管挑出最好的那个答案,整体表现就会稳定得多。
这就是研究团队构建"异质性集成系统"的基本逻辑。所谓"异质性",意思是这七个AI模型来自不同的开发团队、有不同的训练背景、规模差异悬殊,大的有3570亿参数,小的只有70亿参数——差距相当于一支职业篮球队和一支街头三人队。这七个模型分别是来自Google的Gemini-3-Pro-Preview、来自清华的GLM-4.6(3570亿参数)、Meta的Llama-3.3-70B-Instruct(700亿参数)、阿里的Qwen3-235B-A22B-Instruct-2507(2350亿参数)、Anthropic的Claude 4.5 Haiku、阿里的Qwen2.5-32B-Instruct(320亿参数),以及团队自己训练的小模型Meno-Lite-0.1(70亿参数)。
这七位"选手"还被分成了两个小组,采用不同的出题方式。第一组四个模型只使用一套精心设计的系统提示词,第二组三个模型则在提示词之外额外提供几个示范例子,相当于在考试前给应聘者看几道样题。评委的角色由OpenAI的GPT-4o-mini担任,它的任务是审查七个候选答案,给每个答案打一个忠实度分数,然后选出最高分对应的那个答案作为最终输出。
研究结果清楚地证明了这种"组队策略"的价值。七个模型中最强的单个选手GLM-4.6独自上阵得分0.748,而七人组队加上评委挑选之后,得分跃升到0.783——也就是说,团队协作带来了实实在在的提升,不是靠运气,而是靠互补。
二、提示词的艺术:怎么跟AI说话才算说对了?
在深入了解这两组模型各自用了什么"出题方式"之前,先理解一个概念:提示词(prompt),就是给AI下达指令的那段文字。它就像工作说明书,写得清楚,AI就能发挥好;写得模糊,AI就容易走偏。
第一组模型使用的系统提示词经历了一套颇为有趣的自我迭代过程。研究团队没有凭感觉写,而是先从训练数据里随机抽取30个例子,让Gemini模型分析这些例子里一个表现优秀的AI助手是怎么行事的——比如"它会把文件里的原话直接搬过来用,而不是自己重新组织语言","它在遇到二元问题(是/否问题)时会直接以'是'或'否'开头,紧接着给出证据","它不会把自己知道但文件里没有的信息混进去"。Gemini把这些行为特征归纳后,合成了一套候选提示词P。
这套提示词强调了五条核心行为准则:严格依赖文件内容而不添加外部知识、尽量直接引用原文措辞而非重新改写、将来自多个文件的信息综合成中立客观的表述、直接简洁地回答而不加废话,以及保持原始文件的格式和细节。
然而当团队让Gemini进一步"自我批评"、优化这套提示词时,反而搞砸了。改版后的提示词P2鼓励模型"尽量给出最有帮助的答案",结果模型开始在没有证据时也强行作答,在需要说"我不知道"的时候绕着弯子给假答案。评测分数从0.757直接跌到了0.648。这个教训颇具警示意义:AI在被鼓励"更积极"的时候,往往会走向"更不诚实"。于是团队明智地放弃了P2,坚持使用原版P。
第二组模型的策略则更接地气——给几道带答案的例题看看,让模型理解规则。但团队没有随便挑例题,而是把所有训练数据按照情境结构分成了三类。第一类是既有对话历史也有参考文件的"完整情境"——这是最常见也最复杂的情况;第二类是有对话历史但没有参考文件的"空文件情境"——模型必须意识到这时候应该说"我找不到答案";第三类是没有对话历史但有文件的"冷启动情境"——相当于对话的第一轮提问。
从每一类中,团队用数学方法找出最"典型"的代表例子(技术上叫做"中心点",即与同类其他例子距离之和最小的那个),前两类各挑一个,第三类挑两个,凑成四个示范例子提供给第二组模型。这种做法的效果在"含混不清"的问题上最为明显——有了例题参考后,模型对这类需要反问用户的情况处理能力提升了将近4个百分点。
三、"我不知道"是一种智慧:如何判断该不该回答
这项研究中有一个令人印象深刻的发现,涉及的是AI最难学会的技能之一:知道什么时候该闭嘴。
在507道测试题中,有97道是"无法回答"的题——也就是说,根据提供的参考文件,根本找不到答案。在真实场景里,这类情况通常伴随着一堆"干扰文件"——文件存在,但内容跟问题无关。然而这次竞赛的设计里存在一个漏洞:所有无法回答的题,提供的参考文件都是空的。于是团队直接利用了这个规律,设置了一条简单规则:只要参考文件为空,就不调用任何AI模型,直接输出固定回答"I don't have an answer"。这个策略在无法回答类问题上获得了满分。
团队自己在论文中也坦率地指出,这其实是测评设计的一个缺陷,在真实部署环境里这种技巧根本行不通——现实中无法回答的问题往往伴随着看似相关但实则无用的文件,辨别起来需要真正的理解能力。他们建议未来的评测应该为无法回答的问题加入"干扰文件",才能真正考验模型的判断力。
在七个模型中,应对"无法回答"问题的能力差异极大。Claude 4.5 Haiku有79.4%的概率会诚实地说"我不知道",而Qwen2.5-32B-Instruct只有23.7%的概率这么做,大多数时候它会凭空编造答案。更有意思的是,团队自己训练的小模型Meno-Lite-0.1虽然只有70亿参数,这项能力却达到了54%——远超参数量是它4倍多的Qwen2.5-32B-Instruct。这说明在特定任务上进行专项训练,比单纯堆砌模型规模有效得多。
四、团队自训的小模型:以少胜多的"平民选手"
Meno-Lite-0.1这个名字来自柏拉图的对话录《美诺》,书里苏格拉底认为知识是"回忆"而非从头学习。团队反其道而行之:与其让模型把世界知识装进参数里,不如把知识放在外部文件库里,训练模型学会"翻阅文件作答"而不是"凭记忆作答"。
这个小模型的训练过程分两个阶段。第一阶段是持续预训练,用了约13亿个文字符号的双语(中英文)数据,包含英文教育网页、俄语教育文本、俄语教育PDF以及俄语政府文件语料,目的是让模型保持双语能力、不忘记原本学过的东西。第二阶段是监督微调,用了约5000万个文字符号的指令数据,专门训练它在"找到关键信息、提取、综合、作答"这条流水线上更熟练,其中包括多跳问答(需要在多个文件间串联线索才能作答)和RAG场景下的指令跟随。
从基准测评来看,这个小模型的表现相当惊人。在俄语综合评测MERA上,它得了0.555分,与Meta的Llama-3.3-70B(700亿参数)持平,而远超同尺寸基础模型Qwen2.5-7B的0.482分。在俄语知识图谱构建任务NEREL-bench上,它以0.468的综合分数击败了Qwen2.5-32B-Instruct(0.416分)和Gemma-3-27B(0.396分)——后两者的参数量分别是它的4倍和近4倍。在长文本理解测评LIBRA中,它在4千到6.4万字符长度的文本里几乎完美完成了"找到指定信息"的任务,而且在部分短文本场景下的多跳问答甚至超过了更大的14B参数模型。
当然,这个小模型也有明显的局限。它不适合没有外部文件辅助的纯知识问答,函数调用能力一般(58.9%对比同类基础模型的76.1%),在超过3.2万字符的超长文本上复杂推理也会退化。但在"有文件可查"的场景里,它的性价比相当突出,可以跑在单张消费级显卡上,而不需要企业级服务器集群。
五、评委评分:如何衡量一个回答的好坏
这次竞赛的评分体系由三个维度构成,可以理解为从三个不同角度给答案打分。
第一个维度叫RB_alg,是把系统生成的答案和标准参考答案进行文字上的比对,看有多少词汇和句子结构是重叠的——这就像老师用红笔对照标准答案批卷,圈出你答对了多少关键词。具体来说它综合了BERTScore(一种理解语义相似度的算法)和ROUGE-L(一种衡量最长公共子序列的算法)。
第二个维度叫RB_llm,是让另一个AI扮演评分官,判断系统回答与标准答案在语义和逻辑层面是否吻合——相当于让一位阅卷老师用理解力而非机械对照来打分。
第三个维度叫RL_F,完全不看标准答案,只问一个问题:系统的回答有没有超出提供文件的范围?换句话说,有没有"捏造"未在文件中出现的内容?这一维度叫做"参考无关的忠实度"。
对于那些无法回答的问题,评测还引入了一套"条件分"机制:用一个AI法官判断系统有没有正确说出"我不知道",如果说对了,才给这道题打分;否则算零分。最终提交的官方得分是这三个条件分的调和平均值HM3,这种取平均的方式确保了任何一个维度特别差都会拖累总分,促使系统在三个方向上均衡发展。
GPT-4o-mini作为团队内部的候选答案选择评委,其评分结果与竞赛主办方多个评委综合评分的相关系数达到了0.95(条件版本),说明用一个AI代替人工团队来做初步筛选是完全可靠的。
六、数字说话:集成系统到底强在哪里?
从各模型的独立得分来看,GLM-4.6以0.748的综合分排名第一,Gemini-3-Pro-Preview以0.740紧随其后,Llama-3.3-70B和Qwen3-235B分别得到0.730和0.720,Claude 4.5 Haiku得到0.710,Qwen2.5-32B得到0.610,Meno-Lite-0.1得到0.590。而七人联手加上评委挑选之后,团队内部评测得分达到0.819,官方公布的最终成绩为0.783。
单独就"可以回答的题"来看,最强的单个选手配上最佳提示词策略(GLM-4.6加示范例题)得分0.782,集成系统得分0.785,差距虽然只有0.3个百分点,但仍然说明团队协作的优势不是靠"我不知道"这个作弊捷径堆出来的——即使只看真正需要回答的题目,集成系统依然略胜一筹。
不过集成系统也不是万能的。在"含混不清"的问题上,最强单个选手(GLM-4.6配示范例题,得分0.381)反而超过了集成系统(0.367)。原因在于评委GPT-4o-mini有时候会偏向挑选听起来自信、内容具体的答案,而这类含混不清的问题本来应该触发"我不确定您问的是哪方面,能否说得更具体?"这样的反问——GLM-4.6配合示范例题在这类情况下更稳定地给出反问,而评委未必总能识别出"反问比作答更正确"这个道理。
随机选答案(不用评委,从七个候选里随机挑一个)的得分会比有评委挑选低2.5个百分点(可回答题)和1.9个百分点(含混不清题)。这说明两件事同时成立:多样性本身就有价值——即使随机选,七人里也比单人强;有判断力的评委在多样性的基础上再添一层收益。
七、测评体系自身的漏洞:拿高分不等于真聪明
研究团队在论文中专门辟出一节,对这次竞赛的评测设计提出了客观的批评,这种自我审视的态度颇值得关注。
最值得关注的漏洞已经提到过:无法回答的问题全都配的是空文件,这让"检测到空文件就说我不知道"变成了一个不需要任何理解能力的作弊策略。在真实应用场景里,无法回答的问题通常伴随着内容不相关但看似有用的干扰文件,判断"这些文件都不能帮我回答这个问题"才是真正考验模型的能力。
另一个问题是标注覆盖的局限性。给训练和测试数据打标注的时候,标注员用自动检索工具找相关文件,但对于"如何开一家小公司"这样的宽泛问题,答案可能散落在大量来源里,工具未必能全部找到,所以标准答案本身就可能是不完整的。这意味着如果一个系统比标注员找到了更多有用的信息,反而可能因为和标准答案不够像而被扣分。
还有一个微妙的问题:RL_F这个"不看标准答案只看忠实度"的指标,可以在评测结束之前就计算出来——这意味着参赛队伍可以用这个指标来指导自己的系统设计,等于把一部分考题答案提前告诉了选手。这种情况下,高分到底是真能力还是对评测规则的适应,就变得难以分辨了。
团队还发现标注答案里存在一些明显错误,比如把IBM Cloud存储桶的数据保留时间跟Watson Assistant的保留时间张冠李戴。这类错误在大量标注工作中几乎难以避免,但会让评分结果多少偏离真实质量。
八、失败在哪里:五类典型错误的解剖
通过逐条人工分析提交结果,团队识别出了五种最常见的失败模式,这些发现对理解AI在多轮对话中的瓶颈很有参考价值。
第一种是遇到含混不清的问题时不反问、而是直接猜一个方向作答。比如用户问"Grey's Anatomy(一部美剧)是哪一季首播的、哪一季结束的?"——文件里描述了好几个不同季的信息,正确做法是反问"您问的是第几季?",但系统往往直接把好几个季的日期全部列出来,回答了一个根本没有被问到的汇总问题。
第二种是内容上没问题、但忽略了对话的实际意图。比如用户在追问"你说的'核对薪资福利页面'是什么意思?我这边没有任何费用吧?"时,正确回答应该明确说"是的,项目对参与者不收费",但系统的回答虽然提到了薪资福利和可能存在的费用,却没有直接解答用户那个最核心的疑问:"我要付钱吗?"
第三种是被无关但显著的信息带偏。当参考文件里包含了很多引人注意但与当前问题无关的细节时,模型有时会把这些细节塞进回答,造成答非所问。
第四种是在忠实度和参考相似度之间的矛盾。偶尔,系统会在保持文件内容大方向正确的前提下,添加一些"延伸推论"——这些推论本身并不荒谬,但文件里没有明确写到,于是在"是否忠实于文件"这一维度被扣分,即便在"是否与参考答案相似"这一维度表现尚可。
第五种是评委和真实评分标准之间的偏差。有个例子颇为典型:用户说"我听说这个工具链在南美洲无法使用",文件里写的是"该工具链在圣保罗可用",系统回答"该工具链在圣保罗可用"——信息属实,但没有明确帮用户把"圣保罗在南美洲、所以用户说法不对"这个逻辑串起来,用户的误解并没有被纠正。这种回答的忠实度评分很高,但在实际沟通效果上却是失败的。
归根结底,这项研究最核心的贡献不是发明了什么全新的AI技术,而是系统性地证明了一个在直觉上听起来"笨拙"却在实际效果上出人意料有效的策略:多样化的团队加上明智的选择,胜过孤注一掷押宝最强单个模型。七个风格各异的AI,用两种不同的提示词策略,遇到空文件就直接说不知道,遇到有文件就让评委从七份答案里挑最忠实的那份——这套"简单但有效"的流水线最终拿到了26支队伍中的第一名,领先幅度超过22%。
当然,这套系统也有它的代价:同时调用七个大模型再加一个评委模型,计算成本相当可观,而且部分模型需要通过商业API访问,不便于独立部署。顺序生成和判断也带来了延迟,对实时应用不够友好。团队在论文中坦诚了这些限制,并指出下一步可以探索"按问题类型分配不同模型"的智能路由策略,比如遇到含混不清的问题就专门调用更擅长反问的Qwen3-235B,遇到部分可答的问题就调用Claude 4.5 Haiku,而不是每次都把七个模型全跑一遍。
对普通用户来说,这项研究意味着未来你在和AI助手多聊几句、连续追问之后,它更有可能给出准确、有依据、并且知道什么时候该说"我不确定"的回答——这种"诚实的智慧"或许比单纯的知识量更重要。对如何构建可靠AI系统感兴趣的读者,可以通过论文编号arXiv:2605.04523在arXiv平台检索完整论文,代码也已在GitHub公开。
Q&A
Q1:什么是检索增强生成(RAG),为什么多轮对话里更难做到?
A:检索增强生成是让AI在回答问题时先去查阅外部文件、再基于文件内容作答,而不是靠自己记住的知识瞎猜。单轮对话只需要查一次文件答一个问题;多轮对话要在记住之前对话内容的同时查新文件作答,还要搞清楚"它""这个""那个"指的是什么,难度大了不止一个量级。
Q2:集成多个大模型再用评委挑答案,成本会不会太高实际用不了?
A:成本确实是这套系统最大的局限之一,论文本身也承认了这一点。同时调用七个模型加一个评委,费用和延迟都不适合实时应用。研究团队建议未来可以用轻量分类器先预测问题类型,再只调用最适合那类问题的一两个模型,从而大幅降低成本,同时尽量保留集成策略的优势。
Q3:Meno-Lite-0.1这个70亿参数的小模型是怎么训练出来超过更大模型的?
A:核心思路是把训练资源集中在"语言理解和信息提取能力"上,而不是让模型记住大量世界知识。通过13亿字符的双语持续预训练保持语言基础,再用5000万字符的专项指令数据强化"查文件作答、提取关键信息、知道何时说不知道"这些具体技能,最终在特定任务上超过了参数量多4倍以上的模型。
好文章,需要你的鼓励
这项联合研究发现,将Muon优化器应用于强化学习智能体训练时,搭配合适的步骤级信用分配机制,可使任务成功率提升88%,揭示了优化器与评分机制需协同设计的新方向。
本文介绍了CPO方法,通过让AI将自身回答与参考答案对比,在词级别识别推理对错,从而提供比熵更精准的强化学习训练信号,数学推理性能提升高达8.5%。
RAGU是一个多步骤知识图谱增强生成系统,配套7B参数的Meno-Lite-0.1模型,通过两段式抽取和去重整合构建高质量知识图谱,在综合推理任务上超越HippoRAG 2,成本仅为商业API的百分之一。