微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 复旦、阿里、斯坦福联手揭秘:为什么同一个AI助手,用不同搜索引擎效果天差地别?

复旦、阿里、斯坦福联手揭秘:为什么同一个AI助手,用不同搜索引擎效果天差地别?

2026-06-23 15:35
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-23 15:35 科技行者

这项由复旦大学、阿里巴巴达摩院、香港中文大学和斯坦福大学联合开展的研究,发表于2026年6月,论文编号为arXiv:2606.16817v1,有兴趣深入了解的读者可以通过该编号查询完整论文。

你有没有注意到,当你在不同搜索引擎上搜索同一个问题时,结果会有很大差异?在百度搜"苹果手机哪款值得买",和在谷歌搜"iPhone which model worth buying",搜索引擎"读懂"你意图的方式其实截然不同。现在,随着AI助手越来越普遍地被用来帮我们查资料、回答问题,一个更深层的麻烦悄悄浮出水面:AI在帮你"查资料"之前,它需要先把你的问题"翻译"成搜索词——而不同的搜索引擎,对于"好搜索词"的定义,竟然大相径庭。

这个研究团队做的事情,就是第一次系统地研究这个问题:AI助手到底能不能学会"看人下菜碟",根据不同搜索引擎的脾气,用最合适的方式提问?

---

一、先搞清楚:AI助手是怎么帮你"查资料"的?

要理解这个研究,得先弄清楚一件事:现在的AI助手回答问题,很多时候并不是单纯靠自己"记忆"里存的知识,而是会先去外部数据库里搜一搜,找到相关资料之后,再结合那些资料给你一个答案。这种模式叫做"检索增强生成",可以理解为:AI先当侦探查案、搜集证据,再当律师综合证据给出结论。

问题出在"查案"这个环节。当AI要去搜索引擎里找相关文章时,它必须把用户的问题改写成一个"搜索词"。而不同的搜索引擎,工作原理完全不同——就好像有的图书管理员擅长根据书名关键词帮你找书,有的图书管理员则更擅长根据你描述的故事内容来帮你定位书籍。如果你跟前者说"请帮我找一本关于中世纪骑士爱情故事的书",他可能一脸茫然;但如果你直接说"骑士 爱情 中世纪",他立刻就能帮你找到。

这个研究最核心的问题就是:AI能不能学会根据不同的"图书管理员",用不同的方式说话?

---

二、四种"图书管理员",脾气各不相同

研究团队选了四种有代表性的搜索引擎(在这个领域叫"检索器")作为研究对象,它们分别代表了完全不同的工作方式。

第一种叫BM25,是一种"关键词专家"。它的工作原理是统计你的搜索词在文章里出现了多少次、有多罕见。这种方式非常古老也非常实用,就像一个只认关键词的图书馆索引系统——你告诉它"苹果 手机 价格",它立刻帮你找所有同时包含这三个词的文章;但如果你跟它说"我想了解一下最近这款手机的市场定价情况",它可能就有点不知所措了,因为你的话里没有它能精准抓住的关键词。

第二种叫Contriever,是一个有趣的"另类"。它是通过把同一篇维基百科文章里的两段文字当作"一对好朋友"来训练的——它认为,同一篇文章里前后出现的两段内容,应该属于相似的话题。这导致它有一个特别的癖好:它最喜欢那些"看起来像目标文章本身"的搜索词。换句话说,你与其问它一个问题,不如直接生成一段类似答案文章风格的文字来搜索,它反而找得更准。

第三种和第四种是两种现代"智能型"检索器:all-MiniLM-L6-v2是一个小巧但经过大量标注数据训练的模型,而Qwen3-Embedding则是体量更大、能力更强的新一代系统。这两种都是通过理解语言的深层含义来匹配相关内容的,更接近人类的理解方式,对搜索词的格式要求也更灵活。

---

三、用强化学习来"调教"AI的搜索习惯

研究团队采用了一种叫做"强化学习"的训练方法,这种方法的逻辑其实跟训练宠物非常相似:每次AI把用户的问题改写成搜索词,然后去对应的搜索引擎里实际搜一搜——如果搜到了正确答案,就给它一个"奖励分";如果搜偏了,就扣分。经过大量这样的试错和反馈,AI逐渐学会了什么样的改写方式最能让这个特定的搜索引擎满意。

具体来说,奖励分的计算方式叫做nDCG@10,可以简单理解为:不仅要找到正确答案,还要让正确答案排在前面。毕竟在实际使用中,搜索引擎给你返回十几条结果,你只会认真看前几条——如果正确答案排在第八位,对你来说几乎等于没找到。

训练所用的底层框架叫GRPO,它的巧妙之处在于不需要一个额外的"裁判模型"来打分,系统自己通过比较同一批不同改写方式的得分高低来判断哪种方式更好,就像让一群选手互相竞争,最终胜出者的策略就是最值得学习的。

这个框架在整个实验中被应用于两种场景:单轮检索(问一次,找一次)和多轮检索(第一次找不准,看看找到了什么,再调整搜索词继续找)。

---

四、AI真的学到了各自的"方言"

实验结果让研究团队颇为振奋。经过强化学习训练后,AI在所有四种搜索引擎上的表现都有了明显提升。以Contriever为例,在RAGBench这个大型测试集上,平均检索质量从45.5分提升到了56.5分;BM25从45.0分提升到了56.9分。这些提升在十多个不同领域的问题上都保持稳定,说明AI确实学到了一些有泛化能力的技巧,而不是单纯死记硬背。

更有意思的是AI到底学到了什么。研究团队提供了一些生动的案例。当用户问"God's Plan是谁写的?",面对Contriever这个检索器,AI没有直接把问题变成搜索词,而是写了一段像维基百科文章一样的段落:"《God's Plan》是加拿大说唱歌手Drake创作并制作的,于2018年发行,是他第五张专辑《Scorpion》的主打单曲,曾登顶Billboard Hot 100……"——用一段假设的目标文章来"钓鱼",让Contriever觉得这就是它要找的文章风格。

反之,当面对BM25检索器时,同样类型的问题,AI的改写策略截然不同。对于"Dwyane Wade现在在哪个球队打球"这个问题,AI没有生成任何长篇大论,而是简洁地输出:"Dwyane Wade current team"——就是几个精准的关键词。AI甚至在思考过程中明确分析道:"BM25是一个基于关键词的检索系统,我需要确保这些关键词都包含在内,'current team'比'play for right now'更可能在文章中出现……"

---

五、两种检索器之间的鸿沟,本质是"说话风格"的差异

研究团队设计了一种叫做"RE-MMD"的指标,专门用来测量不同搜索引擎所"偏好"的最优搜索词之间的差距有多大。这个指标同时测量两个维度:一是"语义漂移",也就是不同搜索词是否在寻找不同的信息?二是"结构漂移",也就是不同搜索词的表达方式和文字风格差异有多大?

结果非常有说服力。语义漂移的数值普遍极低,基本都在2.0以下,说明不管面对哪个搜索引擎,AI本质上在寻找同样的信息,它的"目标"没有变。但结构漂移的数值就大得多,在关键词型检索器(BM25)和语义型检索器(Contriever)之间,结构漂移值超过了20,比语义漂移高出一个数量级。

这个发现指出了一个很清晰的结论:针对一个搜索引擎训练出来的搜索策略,之所以无法直接用于另一个搜索引擎,不是因为两种策略在寻找不同的东西,而是因为它们说话的"方言"完全不同。就像同样是想找一本书,有人会告诉图书管理员"请给我找一本关于二战中斯大林格勒战役的历史书",有人则会说"斯大林格勒 二战 历史"——寻找的是同一本书,但表达方式决定了谁能找到。这也意味着,为某个搜索引擎专门优化的AI策略,并不能简单地"移植"到其他搜索引擎上,必须针对每个搜索引擎重新训练。

---

六、人类专家的经验值多少钱?

研究团队还系统地研究了一个实际问题:在训练过程中,告诉AI多少关于搜索引擎工作原理的"背景知识",会产生怎样的影响?

团队设计了三种不同程度的提示方式。第一种是"通用提示":只告诉AI一些通用的搜索词改写技巧,包括语义扩展、问题分解、关键词提取等五种方法,但不告诉AI面对的是哪个搜索引擎,让它完全靠自己在强化学习过程中摸索。第二种是"探索型提示":告诉AI它在使用哪个搜索引擎,以及这个搜索引擎的大致工作原理,鼓励它自行推断最优策略。第三种是"专家型提示":直接告诉AI人类专家认为的最优策略,比如对Contriever就明确说"请使用假设文档生成方法",对BM25则说"请提取核心关键词"。

实验结果呈现出一个有趣的分裂:对于Contriever,"专家型提示"最终表现最好,因为Contriever的工作原理比较独特,AI如果没有提示,在早期探索阶段很容易走偏——它会误以为关键词匹配对Contriever也有效,从而陷入一个次优策略的陷阱,大约在第200个训练步骤时就停止进步了。而明确的专家指导帮助它避开了这个弯路,最终到达了更高的性能峰值。

对于BM25,情况却相反:探索型提示的效果反而略优于专家型提示。原因在于BM25是一个历史悠久、在网络上有大量资料介绍的检索系统,AI在预训练阶段就已经积累了不少关于BM25工作原理的知识,不需要人类手把手指导也能很快悟出关键词策略。而过于刚性的专家指令反而限制了AI进一步优化细节的空间。

这个规律背后有一个直觉上很好理解的原理:当AI对某件事的自我认知比较贫乏时,人类的指导能有效帮它少走弯路;但当AI本身对某件事已经有足够的了解时,给它一定的自由探索空间反而能发现人类专家没想到的策略。

---

七、更大的模型,发现了人类专家没想到的招

研究团队还测试了不同规模的AI模型——从4B参数到8B再到14B(参数数量可以粗略理解为模型的"大脑容量")。

4B和8B的模型在探索型提示下,都会比较快地收敛到一个"还不错但不是最优"的策略——通常是某种加长版的问句改写。而14B的模型却做出了一件让研究团队颇为惊喜的事情:它发现了一种人类专家完全没有预料到的策略。

具体案例非常生动。对于问题"Is it possible to be white and Latino?"(一个人能同时是白人和拉丁裔吗),人类专家预期的改写方式是生成一段类似维基百科文章的假设文档,或者把问题改写成自然语言的陈述。14B模型经过大量强化学习训练后,最终摸索出了一个极简策略——把这个问题改写成"Being white and Latino"(做白人同时也是拉丁裔)这样一个简洁的名词短语,仿佛在给一个概念命名,而不是在提问。

这个改写方式的nDCG@10得分高达0.965,接近满分;而把问题改写成"Can someone be both white and Latino?"这样自然的问句,得分只有0.542。短短五个词,胜过了一整个自然语言的问句。这说明大模型在足够充分的探索空间里,能够发现人类直觉之外的有效策略。

从学习过程来看,更大的模型在训练初期往往表现更差——因为它会探索更多的可能性,其中很多一开始都是无效的。但正是这种"敢于乱试"的勇气,最终让它找到了别的模型找不到的路。

---

八、两轮检索比一轮更聪明,但训练很容易崩

研究团队还探索了让AI进行多轮检索的可能性。逻辑很直观:第一次搜索就算没找到最准确的答案,至少能看到搜索引擎返回了哪些文章——这些文章本身就是关于"这个搜索引擎里有什么"的宝贵线索,可以帮助AI在第二轮改写出更精准的搜索词。

一个四轮检索的案例展示了这个过程:用户问的是"如果美元不再是世界储备货币,会有什么影响?"第一轮,AI生成了一段非常通用的假设文档,搜索结果质量很差(nDCG@10为0);但通过观察返回的文档,AI注意到这个语料库里包含大量企业财务报告(10-K年报),于是第二轮改写时引入了"去美元化"、"人民币"、"全球金融体系"等更具体的词,分数提升到了56.84;第四轮时,AI已经完全掌握了这个语料库的"口味",改写成了充满财务报告专业术语的问题,最终得分飙升至93.74,接近满分。

然而,训练多轮检索系统有一个棘手的问题:第一轮和第二轮的奖励信号会互相干扰,导致训练过程极不稳定,模型很容易"崩掉"。

研究团队为此发明了一种叫"分支式展开"的训练技巧。普通的做法是让16个"平行宇宙"各自独立地完成两轮检索,这样每个两轮轨迹都是独立的,第一轮好不好、第二轮好不好,信号混在一起很难区分。而分支式展开的做法是:先让4个不同的第一轮改写策略各自完成搜索,然后对每个第一轮结果,再分别生成4个不同的第二轮改写策略——也就是4×4的树状结构。

这样做的好处在于,对于第二轮的训练,第一轮的结果是固定的"背景",4个第二轮策略在同样的起点下竞争,谁的改写更好一目了然,不会被第一轮的好坏所干扰;对于第一轮的训练,它的价值则由这4个第二轮结果的平均分来估计,一个平均值远比单一随机样本稳定。实验图表清晰地显示,独立式训练策略在约150步左右出现了明显的训练崩溃,而分支式训练则持续稳定地提升,直到250步仍保持良好状态。

---

九、在金融领域和陌生题库上,依然表现出色

研究团队还测试了这套方法的泛化能力。一方面,他们在完全没有见过的测试集(BEIR基准)上零样本测试——也就是训练时完全没有见过这类问题,直接上场答题。结果显示,经过训练的AI查询改写器将Contriever检索器的平均性能从28.84提升到了34.98,提升幅度相当可观。

相比之下,研究团队还测试了直接调用谷歌最新的Gemini-2.5-Flash模型来做查询改写,无论用通用提示还是针对Contriever的专属提示,Gemini的表现反而不如原始Contriever,说明一个强大的通用AI,如果没有针对特定检索环境的专门训练,反而可能帮倒忙。

另一方面,在FinAgentBench这个专门考察金融领域文档检索的测试集上,训练好的AI也对所有四种检索器都带来了提升——Contriever从6.43升至7.39,BM25从8.17升至9.02,Qwen3-Embedding从9.10升至10.81。金融文档有自己独特的语言习惯和术语体系,这个领域的文档也和普通训练数据差异很大,但AI依然成功地适应了这个新环境。

这些提升不仅仅体现在检索环节,研究团队还专门验证了检索质量的提升是否真的能带动最终答案质量的提升。在HotpotQA这个数据集上,他们让AI检索后,再用Qwen2.5-7B-Instruct这个模型来根据检索结果生成答案,结果显示准确率从41.4%提升到了46.9%,F1分从41.0提升到了46.0,精确匹配率从31.2%提升到了35.2%——"找得准"确实能让AI"答得好"。

---

说到底,这项研究揭示了一个在AI时代颇为实用的道理:工具不同,方法就得不同,没有放之四海而皆准的万能搜索词。就像面对一个只认关键词的老式图书管理员,和面对一个能理解自然语言的智能助手,你提问的方式本该截然不同——现在这个研究告诉我们,AI也可以学会这种"看人下菜碟"的能力,而且学得相当不错。

对于普通用户来说,这意味着未来的AI助手在帮你查资料时,将会更加"聪明"地适配后台的搜索系统,而不是用一套固定的方式应付所有情况。对于企业或开发者来说,这项研究提供了一套完整的方法论:通过强化学习训练专门适配特定检索环境的查询改写器,并且明确了什么时候需要人类专家介入引导、什么时候更应该让AI自由探索。

这项研究目前还有两个局限值得关注:一是只研究了文字类的搜索引擎,图片、音频等多模态的情况还没有涉及;二是多轮检索只测试了两轮,更长的检索链条是否同样有效,还需要进一步研究。

有兴趣深入研究的读者可以通过arXiv:2606.16817v1找到完整论文,代码和相关资源也已开放在LCO-Embedding/Envs-aware-Information-Retrieval项目中。

---

Q&A

Q1:Contriever检索器为什么偏爱"文档风格"的搜索词?

A:Contriever在训练时,是把同一篇维基百科文章里的两个段落当作"相似内容对"来学习的,这让它特别擅长识别"风格和内容相似的文档"。因此,当你给它一段看起来像目标文章本身的文字(而不是一个问句),它反而能更准确地找到真正的目标文档。用问句问它,效果反而不如用假设的目标文章段落来"钓鱼"。

Q2:强化学习训练AI改写搜索词,和直接告诉AI如何改写有什么区别?

A:直接告诉AI(比如Gemini)如何改写,相当于让一个从未实际用过这个搜索引擎的人给建议,建议可能听起来合理但实际效果差。而强化学习是让AI真正去搜索引擎里"试",搜到了就奖励、搜偏了就扣分,通过大量实际反馈逐渐摸索出最有效的策略。实验显示,经过训练的改写器在陌生数据集上性能提升明显,而直接调用Gemini的结果反而低于不改写的基线。

Q3:分支式展开训练技术解决了什么问题?

A:多轮检索训练时,第一轮搜索好不好和第二轮搜索好不好的奖励信号会混在一起,导致AI无法准确判断"是我第一步的问题还是第二步的问题",训练容易崩溃。分支式展开让每个第一轮结果对应多个不同的第二轮尝试,第二轮的训练信号因此不受第一轮好坏干扰,同时第一轮的价值由多个第二轮结果平均估算,大大减少了随机噪音带来的误判。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-