微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 斯坦福与新加坡国立大学联手揭秘:当AI"偷师"遇上聪明的防守,谁才能笑到最后?

斯坦福与新加坡国立大学联手揭秘:当AI"偷师"遇上聪明的防守,谁才能笑到最后?

2026-06-15 11:47
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-15 11:47 科技行者

这项由斯坦福大学、丰田技术研究所芝加哥分院以及新加坡国立大学联合开展的研究,发表于2026年5月,论文编号为arXiv:2605.22737,有兴趣深入了解的读者可以通过该编号查询完整论文。

一个你每天都在经历却浑然不觉的商业博弈

每当你向某个AI助手提问,它回答你的那一刻,一场悄无声息的博弈就已经开始了。

这场博弈的一方,是花费了巨额资金训练出聪明AI的公司——我们姑且叫它"老师"。另一方,是那些想要"白嫖"老师智慧的竞争对手——我们叫它"学生"。学生的手段很简单:大量向老师提问,把老师回答的内容收集起来,然后用这些内容训练自己的AI,从而获得和老师相近的能力,却不用付出老师十分之一的成本。这个过程,在学术圈被称为"蒸馏攻击",说白了就是"抄捷径学本事"。

这个问题听起来离普通人很远,但实际上,每一次你使用某个AI服务,背后都可能牵涉这场博弈。AI公司花大钱培养出的"明星老师",随时可能被人廉价复制。更令人担忧的是,这种复制不仅仅是商业上的损失,还可能加速某些危险能力的传播。

斯坦福等机构的这支研究团队注意到,目前学界对这个问题的研究存在一个根本性的漏洞:大家都在研究如何防御"偷师",却从来没有认真考虑过,现实中真正的"偷师者"会有多聪明。换句话说,现有的防御手段,其实都是在对抗一个过于理想化、过于"老实"的假想敌。

正是为了填补这个漏洞,研究团队构建了一个全新的博弈框架——他们将整件事建模为一场"老师"与"学生"之间的策略游戏,并由此推导出了聪明学生的最优策略和聪明老师的最优防御方案。

一、为什么现有的"防偷师"方案都被高估了

在理解研究团队的突破之前,有必要先弄清楚当前学术界是如何评估防御效果的。

现有的防御研究通常是这样运作的:研究者设计出一套修改AI输出内容的方案,让AI的回答变得"没那么有用",从而让偷师者难以模仿。然后,他们找一个"学生"AI,让这个学生老老实实地用防御后的输出内容训练,看看学生最终学到了多少东西。如果学生学到的东西很少,就说明防御成功了。

问题在于,这个测试中的"学生"太老实了。它对老师给的每条回答都一视同仁,完全没有选择地全部吸收,就像一个不会挑食的孩子,不管碗里是什么都往嘴里塞。

但现实中,真正想要偷师的竞争对手,绝对不会这么傻。他们会仔细观察老师给出的每条回答,判断哪些回答对自己最有价值,然后重点学习这些高价值的内容,忽略那些没用的垃圾信息。

研究团队在论文中展示了一个非常生动的例子来说明什么叫"高价值"和"低价值"的输出。当老师AI被要求解释一道数学题时,如果它给出了清晰、完整的推理过程,一步一步把答案推导出来,这就是高价值的内容——学生可以从中学到真正的推理能力。但如果老师的输出充斥着大量重复的无意义词汇(论文中出现的真实案例是大量重复的"raiding"这个词),那这条输出对学生来说毫无价值,甚至是有害的噪音。

一个聪明的偷师者,当然会把重心放在前者,完全抛弃后者。现有的防御评估方案忽视了这一点,导致所有"防御效果"的数字都被严重高估了。

二、用博弈论搭建一个公平的擂台

面对这个问题,研究团队没有像过去那样,孤立地设计防御方案或攻击方案,而是把整件事用一个统一的数学框架来描述——一场minimax博弈(可以理解为"你中有我,我中有你"的策略对抗游戏)。

这个博弈框架的核心思想是:老师和学生各自都有一个"预算",规定了他们可以偏离默认状态多远。老师有一个"保真预算",意思是它修改自己输出内容的程度不能太大,否则输出的内容对真正的用户就毫无用处了。学生有一个"适应预算",意思是它可以对老师的输出进行筛选和重新加权,但不能凭空发明新数据。

框架的另一个关键组成部分是"价值函数"。每一条老师的输出(一个问题加上对应的回答),都可以被赋予一个分数,代表学生从这条输出中能学到多少东西。价值越高,这条输出对偷师者越有用,老师就越应该压制它;价值越低,即使被学生获得也无伤大雅。

这个框架的精妙之处在于,它把两件原本分开讨论的事情——"学生应该如何聪明地偷师"和"老师应该如何防御"——统一到同一个数学结构中,用同一套语言来表达。由此,研究团队得以推导出双方的"最优策略",也就是数学上的"最佳应对方案"。

三、聪明学生的武器:给每条数据打分,然后重点押注

根据博弈论框架推导出的结论,聪明学生的最优策略出人意料地简洁:对老师给出的每条回答计算一个"价值分数",然后在训练时,价值高的回答就多学几遍,价值低的就少学甚至不学。

具体怎么计算这个价值分数呢?研究团队给出了一个直觉上很有道理的方法:对于每条(问题,回答)对,学生可以先计算"如果我多学习这条数据,我的整体能力会提升多少"。用更技术化的语言来说,就是计算这条数据的"梯度"(理解为"学习这条数据能让我朝正确方向迈多大的步")与"我目前在整体任务上的改进方向"之间的相似度。两者越一致,这条数据的价值就越高。

在实际操作中,研究团队实现了一个可以在训练过程中动态调整权重的算法:在每个训练批次里,学生AI会评估当前批次中每条数据的价值,然后把更多的"注意力"分配给高价值的数据。这就好比一个备考的学生,每天都在重新评估哪些知识点最值得今晚重点复习,而不是机械地从第一页翻到最后一页。

这个策略有一个可以调节的"锐度参数"。当这个参数为零时,学生会均等地对待所有数据,等同于"老实的学生"。当参数调高时,学生会越来越专注于高价值数据,理论上能从同样的原始数据中榨取出更多的学习效果。

四、老师的盾牌:让输出变得"对我有用,对你没用"

知道了聪明学生会怎么偷师,老师的防御方向也就清晰了:想办法压制那些对学生价值最高的输出。

博弈框架给出的老师最优策略,同样是一种"倾斜"操作,只不过方向相反——把输出概率向价值低的方向倾斜。换句话说,老师要让"高价值但有害的回答"出现得更少,让"低价值且安全的回答"出现得更多。

目前学术界最先进的防御方法叫做"抗蒸馏采样"(简称ADS),正是这个思路的一种实现。它在老师AI生成回答的过程中,实时计算每个词汇选项对学生的"梯度价值",然后故意降低那些"对学生最有学习价值的词"被选中的概率。通俗地说,就是老师在说话时,刻意绕开最清晰、最有教学价值的表达方式,转而用更绕弯、更难被模仿的方式来表达同样的意思。

这种方法有效,但代价高昂:在生成每一个词的时候,都需要调用学生AI进行梯度计算,运算量非常大,导致老师的"说话速度"(生成速度)降低了将近3倍。

研究团队由此受到启发,提出了一种更廉价的防御方案。

五、专家乘积(PoE):一种聪明而廉价的新防御

研究团队注意到,"价值最高的输出"往往有一个共同特征:老师觉得它非常自然、非常流畅,但学生却觉得它很难预测、很陌生。换句话说,如果老师的输出对老师本身来说似乎"很合理",但对学生来说"完全出乎意料",那这个输出对学生来说就极具学习价值——因为这正是学生还不会、正需要学习的地方。

基于这个洞察,研究团队提出了一个更简单的价值代理指标:直接计算同一条输出在老师眼中的"合理程度"与在学生眼中的"合理程度"之差。差距越大,这条输出的价值越高,老师就越应该避免产生这样的输出。

将这个逻辑带入数学推导,结果会得到一个令人意外的简洁公式:防御后的老师输出概率,等于原始老师概率和学生概率的几何平均。也就是说,老师在生成每个词时,只需要同时参考自己和学生的预测,取一个"折中"——偏向两者都认为合理的词,远离只有老师认为合理、学生完全不懂的词。

这个方案被研究团队命名为"专家乘积"(Product-of-Experts,简称PoE),名字来自机器学习中一个经典的思路:把多个模型的判断相乘,得到一个更综合的判断。

PoE方案最大的优点在于它的计算效率。它不需要任何梯度计算——只需要在生成每个词时,同时运行老师和学生两个模型,查看它们各自预测下一个词的概率分布,然后按比例混合。这种操作几乎没有额外的数学开销,只不过需要同时跑两个模型,所以生成速度大约是原来的1.6倍,而不是ADS方案的2.9倍。

此外,PoE方案还有一个意想不到的好处:由于它的逻辑是"选择两者都认可的词",这实际上会让老师的输出更倾向于清晰、结构完整的推理过程,而不是那种混乱、重复的"垃圾输出"。从用户体验的角度来看,PoE保护下的老师AI,其输出质量反而可能比ADS保护下的更好。

六、实验结果:当"聪明学生"上场,防线崩溃了多少

研究团队在两个数学推理基准测试(GSM8K,一个初等数学题集;MATH,一个更难的竞赛数学题集)上进行了系统性的实验。他们使用的老师模型是DeepSeek-R1-Distill-Qwen-7B,一个以链式推理著称的开源模型;学生模型是Llama-3.2-3B,一个体量更小的模型;代理学生(用于老师防御)是Qwen2.5-3B。

实验分两组进行:一组是"老实学生"(均等使用所有数据),另一组是"聪明学生"(用研究团队的价值加权方案训练)。实验结果颇为惊人。

以GSM8K为例,当老师使用最先进的ADS防御时,老实学生的最终准确率只有34%——看起来防御相当成功,毕竟正常情况下学生可以达到57%左右。但当换成聪明学生之后,准确率直接跳到了51%——相对提升幅度高达50%!换句话说,单靠"聪明地选择学哪些数据"这一个动作,就让防御效果打了一个大折扣。

PoE方案在同样条件下,老实学生准确率39%,聪明学生达到49%,相对提升约26%。虽然提升幅度比ADS更小,但绝对准确率反而略低于ADS遭受聪明学生攻击后的数值。

换一个维度来看这个结果:ADS防御在对抗老实学生时,能把学生准确率从57%压到34%,降低了约23个百分点;但在对抗聪明学生时,只能压到51%,实际防御效果只有6个百分点。防御力打了不止七折。

MATH数据集上的结果因为本身数字较小,绝对差异不那么显眼,但方向完全一致:聪明学生在每种防御方案下都显著优于老实学生,相对提升幅度在40%到50%之间。

七、推理质量的比较:PoE意外地更"人性化"

研究团队还做了一件很有意思的事:他们不仅仅关心学生能学到多少,还关心防御之后老师的输出质量是否下降——毕竟,如果老师为了防御而输出一堆乱码,用户体验会变得很差。

为了评估这一点,他们让Claude Sonnet 4.6(Anthropic的旗舰AI模型)充当"质量评判员",用一套专门设计的审核标准,从1到5分评价每条推理链的"可审计性"——即普通人是否能一步一步地核验这条推理的逻辑是否正确。评分标准不在乎推理有多长,只关心每一步是否清晰、相关、可核验。

为了确保这个AI评判员靠谱,研究团队还让人类评分员独立给30条样本打分,结果发现AI评判员与人类评分员的一致性达到了κ=0.76,平均误差只有0.4分,算是相当可靠的评估工具。

实验结果显示,ADS防御后的老师输出,在质量分布上大幅向低分段偏移——大量输出出现了前文提到的"raiding"式重复垃圾内容,推理质量严重下降。而PoE防御后的老师输出,质量分布与未经防御的正常输出非常接近,大部分推理仍然清晰、有条理,只是稍微更简洁了一些。

这个差异有一个直觉上的解释。ADS的逻辑是"哪些词汇对学生最有价值,我就偏偏不选那些词",所以它有时候会做出一些很奇怪的词汇选择,导致推理链变得混乱甚至充满废话。而PoE的逻辑是"选择老师和学生都觉得合理的词",这个约束本质上是一个保守的质量过滤器——它排除的是那些老师很自信但学生完全看不懂的专业内容,保留的恰恰是两者都能理解的通俗表达。结果就是,PoE的输出虽然"教学价值"降低了,但对普通用户来说,反而更易读、更清晰。

研究团队还发现一个有趣的现象:PoE有时候不仅仅是把推理链变短,还会换一种完全不同的思路来解题。比如在某道函数方程题中,未防御的老师和ADS老师都选择先推导函数的一般形式f(x)=k/x,再代入求值;而PoE老师却直接把两个已知点代入函数方程,一步就算出了答案。两种路径都正确,但PoE选择的路径更简洁直接。

八、真实世界的蒸馏威胁:就连摘要都在泄露秘密

研究论文还包含一个颇具现实意义的附加实验:他们测试了用三个主流商业AI(GPT、Claude、Gemini)的真实输出来训练学生,看看能学到多少能力。

结果令人印象深刻。以GSM8K为例,未经训练的Llama-3.2-3B准确率只有区区0.76%(几乎完全不会做数学题)。用简单的"问题+答案"对来训练后,准确率提升到3.43%,只是略有改善。但如果用GPT、Claude或Gemini的完整推理链来训练,准确率分别跳升至54.78%、53.57%和51.75%——提升幅度高达数十倍。

这个数字说明,商业AI输出的"推理过程"确实蕴含着极为丰富的学习信号,远不只是最终答案那么简单。

更值得注意的是,研究团队在论文中指出,目前很多大公司已经开始限制AI输出完整的推理链,转而只给用户提供较短的总结版本。这个做法是否能有效阻止蒸馏攻击?研究团队的初步结论是:不能完全阻止。就算是经过压缩的摘要,里面仍然包含足以让学生AI显著提升能力的信号。真正消除蒸馏风险,只有完全不暴露任何有价值的中间推理步骤——但那样的话,AI对用户也就没什么用了。这正是这场博弈最根本的两难困境。

九、这一切对未来意味着什么

这项研究最重要的贡献,或许不是那两个具体的技术方案(聪明学生和PoE防御),而是它改变了这个领域的评估范式。

过去,研究者们设计防御方案,然后用"老实学生"来测试,如果老实学生学不到什么,就宣布防御成功。这就好比一家超市为了防盗,只测试过不会翻窗户的小偷,却没有考虑到那些会锁匠技术的专业窃贼。

这个框架告诉大家:任何防御方案的测试,都必须包含一个"聪明学生"的测试,否则结论都是失真的。这个结论看起来简单,但它的影响是深远的——它意味着过去几年所有防蒸馏研究的"防御效果数据",都可能被显著高估了。

归根结底,这场"老师"和"学生"之间的博弈,目前还没有完美的终点。研究团队明确指出,在他们的实验条件下,即使是最强的防御方案,在面对聪明学生时,也无法阻止相当一部分能力的泄漏。从某种程度上说,只要AI公司还在向用户提供有价值的输出,蒸馏攻击就永远无法被完全消灭——因为有价值的输出,本质上就包含了学习信号。

这场博弈将会持续下去。但至少现在,评判"谁赢了"的标准,变得更加公平和现实了。对于普通人来说,这意味着我们在未来有望看到更多高质量、更难被廉价复制的AI服务——尽管背后的技术角力,远比你我所能想象的复杂。

感兴趣的读者可以通过编号 arXiv:2605.22737 查阅完整论文,其中包含了完整的数学推导、实验细节以及大量示例推理链的对比。

---

Q&A

Q1:蒸馏攻击和普通的AI模型训练有什么区别?

A:普通AI训练需要大量原始数据和巨大算力,从零开始培养能力。蒸馏攻击则是直接向已有的强大AI提问,收集它的回答,再用这些回答来训练自己的小模型,相当于"站在巨人肩膀上",以极低的成本复制巨人的部分能力,代价只是不断地提问。

Q2:专家乘积(PoE)防御为什么比抗蒸馏采样(ADS)更值得推荐?

A:在面对聪明学生的攻击时,ADS和PoE的实际防御效果相差无几,但ADS的生成速度会降低近3倍,而PoE只降低约1.6倍。更关键的是,ADS经常产生充斥着无意义重复词的混乱输出,严重影响用户体验,而PoE的输出质量与正常AI接近,推理链清晰易读。

Q3:目前AI公司限制输出完整推理过程,能防止蒸馏攻击吗?

A:根据这项研究,效果有限。实验显示,即便只提供压缩后的摘要式输出,学生AI仍能从中提取足够的学习信号,显著提升自身能力。只要AI输出对用户有价值,其中就必然包含学习信号,这是一个根本性的两难困境,目前没有完美解决方案。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-