
这项由西安交通-利物浦大学与香港中文大学联合开展的研究,以预印本形式于2026年6月发布在arXiv平台,编号为arXiv:2606.04767,目前正处于期刊审稿阶段。研究的核心问题是:我们怎么知道一个AI模型在面对刻意制造的干扰时有多脆弱?
先从一个场景说起。假设你面前有一台精密的地震仪,它能够在地震发生之前,通过持续监测地面的微弱震动来判断这片土地有多"容易被摇动"。不需要等地震真的来了才知道危险,也不需要派人去用锤子凿地来测试。地震仪本身就是一种预测性的、内在的测量工具。
现在,AI领域正面临类似的难题。自动驾驶汽车、医疗图像诊断、金融风控系统——这些高度依赖深度神经网络的场景,都需要确保模型不会被一点点微小的干扰所欺骗。比如,有人在一张停车标志上贴几块胶布,AI的视觉系统就可能误读为限速标志,后果不堪设想。这种对模型施加细微扰动使其出错的手段,业界称之为"对抗性攻击"。
目前评估模型抗攻击能力的主流方法,就像是直接拿锤子去敲地板——反复发起真实的攻击,看模型什么时候会出错。这类方法需要消耗大量算力,而且强烈依赖攻击者选择的具体攻击方式,换一种攻击手法结果就可能完全不同。更麻烦的是,它只告诉你"这次攻击成没成功",却无法揭示模型本身为什么脆弱,脆弱的根源在哪里。
正是在这样的背景下,这支研究团队拿出了一套全新的思路:与其反复发起攻击来测试,不如在模型内部找到一个"内在的脆弱性信号"——就像那台地震仪一样。他们选中的这个信号,叫做**费舍尔信息矩阵的谱范数**。这个名字听起来相当学术,但它背后的直觉其实并不难理解,而且这项研究在理论推导、算法设计和实验验证三个层面都做出了系统性的贡献。
---
一、为什么需要一台"AI脆弱性地震仪"
要理解这套框架,先得理解AI模型在做什么。当一个图像分类模型看到一张猫的照片,它内部会输出一组概率分布,比如"95%是猫,3%是狗,2%是其他"。这组概率分布,就是模型对这张图片的"判断意见"。
现在,有人悄悄把这张猫的照片稍微改动了一点点——改动小到肉眼几乎看不出来——但模型输出的概率分布却发生了剧变,变成"10%是猫,80%是狗"。这就是一次成功的对抗性攻击。模型对微小输入变化的"反应有多激烈",正是衡量其脆弱性的核心。
研究团队将这个问题转化为一个信息几何的问题:当输入图片从x变到x加上一点扰动δ时,模型输出的概率分布在"概率的世界"里移动了多远?衡量两个概率分布之间距离的经典工具叫做KL散度,可以把它理解为两个"意见"之间的分歧有多大。
团队证明了一个关键定理(论文中的定理1):当扰动δ比较小时,这个分歧的大小近似等于一个简洁的数学表达式,其中涉及的核心对象正是费舍尔信息矩阵F(x)。具体来说,最糟糕的扰动——也就是能让模型"意见"改变最大的那个微小扰动——大约等于F(x)最大特征向量的方向,而F(x)最大特征值(也叫谱范数,记作‖F(x)‖?)则衡量了这种最坏情况下的影响有多大。
换句话说,F(x)的谱范数就是那台"地震仪的读数":读数越高,说明模型在当前输入附近越容易被摇动;读数越低,说明模型越稳健。基于此,团队定义了两个实用的稳健性度量指标。R????是F(x)谱范数的平均值,与模型脆弱性正相关,数值越大说明越危险。R???c是其倒数的平均值,与稳健性正相关,数值越大说明越安全。这两个指标不依赖任何特定的攻击算法,因而是"攻击无关"的内在度量。
为了说明这个近似有多可靠,研究团队在CIFAR10数据集上对四种经典模型进行了实验(表9),发现近似误差与F(x)谱范数的比值非常小,通常在千分之一量级,几乎可以忽略不计。在不同数据集上的验证(表10)也给出了类似结论,说明这个理论近似在实际场景中是靠谱的。
---
二、"地震仪"的工作原理:F等于梯度的方差
研究团队还揭示了一个更深层的等式,让这个度量指标有了更直观的物理意义。这就是论文中的定理2:**费舍尔信息矩阵F(x)等于输入雅可比矩阵的方差**。
雅可比矩阵可以理解为"模型对每个像素的敏感程度"——它告诉你,如果稍微改变一下图片的某个像素,模型的每个输出会跟着变多少。对于分类模型来说,有K个类别,就有K列这样的梯度向量。费舍尔信息矩阵,实际上就是这K列梯度向量按照各自类别的预测概率加权后的"离散程度"。
为什么这个等式重要?因为它把费舍尔信息矩阵从抽象的信息论概念,落地为一个关于模型几何敏感性的统计描述。更重要的是,这种加权方式本身就带有模型的"置信度"信息:如果模型非常确定当前图片是猫(某个类别概率接近1),那么其他类别的梯度权重几乎为零,方差就会很小,说明这是一个稳定的区域;如果模型对所有类别都拿不准(概率接近均匀分布),那么方差会很大,说明这里是脆弱的区域,一点点扰动就可能导致预测结果翻转。
这正是这个度量指标优于单纯的梯度范数(比如Lipschitz常数和CLEVER分数)的地方:它不仅仅关注梯度有多大,还关注模型有多"拿不准"。梯度大但模型很确定,可能并不脆弱;模型不确定但梯度不大,也可能被轻易攻破。费舍尔信息矩阵把这两个维度统一了起来。
研究团队通过一个简单的玩具模型(单层卷积+全连接+softmax)验证了这个等式的正确性(表13)。实验显示,随着采样数量从32增加到1024,用样本估计出的梯度方差与真实F(x)之间的相对误差从约1.86持续下降到约1.16,符合大数定律:样本越多,估计越准确。
---
三、从"地震仪读数"到"建筑抗震等级":各架构的理论排名
有了这台"地震仪",研究团队开始给不同结构的AI模型做"抗震等级评定"。这一步需要对各种网络组件的谱范数进行理论分析,再通过链式法则组合起来,得到整个模型的理论上界。
可以把神经网络想象成一条流水线,每个工序都会对"信息的震动"产生不同的影响。有些工序像隔音材料,把震动原样传递过去;有些工序可能放大震动;有些则会抑制震动。研究团队系统分析了深度学习中所有常见组件(表1)。
ReLU激活函数和最大池化层,谱范数严格等于1,意味着它们对扰动既不放大也不缩小,就像一个完全中性的传送带。平均池化层的谱范数是1/k(k是池化窗口大小),窗口越大,平滑效果越强,相当于一个轻微的减震器。批归一化(BN)和层归一化(LN)的谱范数等于缩放参数γ除以标准差σ,如果γ远大于σ会放大扰动,反之则抑制,相当于一个可调节的阀门。Softmax的谱范数最多为1/2,在高维情况下接近于0,有一定的扰动抑制效果。拼接操作(Concatenation)的谱范数与各路输入谱范数的平方和的平方根成正比,可能隐式引入梯度扩张。而卷积层和全连接层的谱范数约等于各自权重矩阵的谱范数,是整个网络中扰动放大的主要来源。
基于这些分析,研究团队对四种经典架构给出了理论上界(表2)。VGG网络由L个卷积层和M个全连接层顺序叠加,没有跳跃连接,理论上界是所有层谱范数的连乘积,随深度呈指数增长,结构复杂度为O(L+M)。ResNet通过残差连接(每个残差块输出等于输入加上变换后的结果),使得雅可比矩阵近似为恒等矩阵加上扰动项,上界增长更温和,以VGG16(13个卷积层,3个全连接层)和ResNet18(12个残差块)为例,ResNet更加稳健。DenseNet的每一层都接收前面所有层的输出,相当于每新增一层就把前面所有层的"震动"都累加进来,虽然单层的连乘更少,但随层数L的增加,上界通过一个连乘积(每项为1加上当前层的谱范数)快速增大,使DenseNet在理论上最不稳健。Transformer(ViT-B-16)通过多头注意力机制(MHA)和前馈网络(FFN)的残差叠加,注意力矩阵的行归一化保证其谱范数等于1,但多头机制引入了√h倍的放大系数(h为注意力头数),综合来看,Transformer的理论上界随层数增长,但由于注意力机制在高维情况下具有天然的平滑效果,整体表现优于DenseNet和VGG。
综合上述分析,研究团队得出了如下的理论稳健性排名:DenseNet121的稳健性最差,其次是VGG16,然后是ResNet18,ViT-B-16最为稳健。研究团队特别指出,这个排名来自架构层面的上界分析,实际在特定数据集上的结果可能因权重值、训练动态和数据分布而有所不同,因此用"?"符号表示的是一种理论趋势而非严格不等式。
---
四、如何高效地读取"地震仪":三种计算算法
理论分析得到的是上界,而实际中要精确计算某个具体模型在某个具体数据集上的F(x)谱范数,就需要实际的计算算法。这里有一个巧妙的工程技巧让计算变得可行。
费舍尔信息矩阵F(x)的维度是输入维度d乘以d——对于一张224×224的彩色图片,d大约是15万,这意味着F(x)是一个150000×150000的矩阵,存储和计算都几乎不可能。但研究团队发现,F(x)可以写成F(x) = QΛQ?的形式,其中Q是K列梯度向量组成的矩阵(K是类别数,通常只有10到1000),Λ是对应预测概率组成的对角矩阵。这意味着F(x)的秩最多是K,而K远小于d。利用谱范数的等价性‖QΛQ?‖? = ‖Λ^(1/2)Q?QΛ^(1/2)‖?,计算对象从d×d矩阵缩减到K×K矩阵,存储复杂度从O(d?)降到O(dK),计算复杂度从O(d?)降到O(dK?+K?)。
在这个低秩结构的基础上,团队设计了三种适用于不同规模场景的算法。
对于规模较小的情形(类别数K较少),直接特征值分解是最简单的选择,时间复杂度O(dK?+K?),空间复杂度O(dK)。这就像把一个紧凑的小机器拆开数零件,每个零件都看得清清楚楚。
对于中等规模,幂迭代算法(Algorithm 1)是一个迭代逼近的方案,时间复杂度O(TdK)(T是迭代次数),空间复杂度O(dK)。算法从一个好的初始向量出发(以当前预测概率最高的类别的梯度方向初始化,加速收敛),反复做矩阵乘法,每次乘法都利用Q和Λ的结构分解成小矩阵运算,当相邻两次的特征值估计值的相对变化小于预设阈值ε时提前退出。这就像用回声定位的方式逐步聚焦,每次回声都让定位更准确,一旦精度够了就停止。
对于大规模场景,Hutchinson近似算法(Algorithm 2)通过随机采样来估计最大特征值(公式13)。算法随机生成M个向量z(每个元素从标准正态分布采样),对每个z计算z?Fz/z?z(即瑞利商),取最大值作为估计。时间复杂度O(MdK),而且M个向量的计算完全可以并行,非常适合GPU。研究团队证明(定理4和5),当M足够大时,这个估计会以高概率收敛到真实的最大特征值,所需的M满足M ≥ log(1/δ)/pε,其中pε是单次随机向量的瑞利商超过目标阈值的概率。
一个重要的实验发现是,用Λ^(1/2)Q?QΛ^(1/2)作为Hutchinson的输入,比直接用F(x) = QΛQ?作为输入效果好得多(表19)。当类别数K=10时,前者的近似误差约14%,而后者高达99.8%,几乎毫无意义。原因在于定理5所描述的"维度诅咒":随机向量在高维空间中与特定方向对齐的概率随维度指数级下降,而Λ^(1/2)Q?QΛ^(1/2)是K×K矩阵,维度由类别数决定;QΛQ?是d×d矩阵,维度由输入像素数决定——后者的维度要高出几个数量级,因此对齐概率极低。此外,在采样分布的选择上,实验表明高斯采样比拉德马赫采样(每个元素随机取±1)的近似误差低得多(表20),例如在1000次采样时,高斯采样误差约12%,而拉德马赫采样误差约54%。
---
五、当模型的内部不可见时:黑盒估计方案
前面三种算法都属于"白盒"场景,需要能够获取模型的内部梯度。但在现实部署中,很多情况下我们面对的是不透明的模型——比如通过API调用的第三方服务,我们只能看到输入对应的输出概率,无法访问内部参数和梯度。
研究团队为这种"黑盒"场景设计了一套基于有限差分的估计方案(公式17和18)。核心思路是用数值差分来近似梯度:对于一个随机方向u,模型在x+hu和x-hu处的对数概率之差除以2h,就是梯度在u方向上的近似投影(h是一个很小的正数,比如0.001)。然后把这个投影值平方,再对多个随机方向u取期望,就得到了F(x)的二次型u ?F(x)u的近似。最后仍然用Hutchinson的取最大值逻辑来估计最大特征值。这整个过程只需要反复查询模型的输出概率,不需要任何内部信息。
从表6的实验结果来看,黑盒估计得到的R????数值比白盒结果低了约三个数量级(Medical Data: 白盒5.95 vs 黑盒0.0056),这是因为黑盒场景下随机向量的维度是完整的输入维度d,远高于白盒场景(白盒利用低秩结构,有效维度是K)。但关键在于,两者给出的**相对排名完全一致**:在ResNet18上,CIFAR100的稳健性高于医疗数据,白盒和黑盒都得出相同结论。这意味着即使在无法接触模型内部的情况下,这套方法依然能够可靠地进行模型间的相对比较。
---
六、"地震仪"的读数靠谱吗?实验验证
理论推导和算法设计完成之后,最关键的问题是:这台"地震仪"的读数,真的能预测模型有多危险吗?研究团队在多个数据集和多种模型上进行了系统性的验证,实验规模覆盖CIFAR10、CIFAR100、Tiny-ImageNet、医疗图像(COVID-19胸部X光数据集)和ImageNet,每次实验随机选取500个样本进行统计,并将结果与Lipschitz常数L(x)、CLEVER分数、CW攻击成功率和PGD攻击成功率进行对比。
第一个关键验证是"经过对抗训练的模型应该更稳健"(表3)。研究团队用ResNet18训练了两个版本:一个是普通的干净模型,一个是经过CW对抗训练的模型。直觉上,对抗训练后的模型应该在所有稳健性指标上表现更好。结果显示,对抗训练后,Lipschitz常数下降了42%,CLEVER分数下降了42.6%,而研究团队的R????下降了65.5%,与CW攻击成功率的降幅(68.4%)最为接近。PGD攻击成功率只下降了12.7%,原因在于训练用的是CW攻击,测试用的是PGD攻击,跨攻击迁移性有限,说明纯攻击指标的局限性。此外,实验还发现,F(x)谱范数、L(x)和CLEVER的估计值在不同样本量下非常稳定(方差极小,见表21和22),而CW和PGD的结果由于包含随机性,波动相对较大。
第二个验证是跨架构的稳健性排名(表4)。在CIFAR10上,按L(x)降序排列,四种模型的顺序是DenseNet121 > ResNet18 > ViT-B-16 > VGG16。R????给出了完全相同的排名,CLEVER的排名也与之一致。R???c的排名则与CW攻击成功率的排名完全相同(均为VGG16 > ResNet18 > ViT-B-16 > DenseNet121)。这说明两个新指标分别从不同角度与经典攻击指标高度吻合,能够在无需实施攻击的情况下得出一致的评估结论。
第三个验证是跨数据集的稳健性比较(表5)。用同一个ResNet18在三个数据集上评估,所有指标(L(x)、CLEVER、CW、R????)都给出一致结论:CIFAR100上的稳健性高于医疗数据,ImageNet的结果比较特殊(因为ImageNet数据分布差异极大,各指标结果出现了与预期不符的情况,这本身也是一个值得进一步研究的发现)。
研究团队还用表16的皮尔逊相关系数分析验证了R???c与Lipschitz常数在单样本级别的线性相关性:在CIFAR10上,四种模型的皮尔逊相关系数都在0.84到0.90之间,斯皮尔曼等级相关系数在0.89到0.95之间,说明两者在个体样本级别也高度一致,而不仅仅是在均值层面。
至于计算效率(表7),新指标R????的白盒计算时间确实比Lipschitz常数和CLEVER更长(ResNet18上分别为267秒 vs 131秒 vs 24.6秒),但研究团队指出这是因为R????提供了比前两者更丰富的信息——不只是梯度的局部斜率,而是涵盖了二阶曲率和概率置信度的综合度量,就像计算协方差矩阵比计算均值更耗时但信息量更大一样。
---
七、这台"地震仪"与其他工具的关系
研究团队在附录A中系统梳理了新度量指标与几类经典方法的数学关系,这部分内容清晰地勾勒出整个框架在已有工具体系中的定位。
对于Lipschitz常数,团队证明了‖F(x)‖? ≤ B(x)·L(x)?,其中B是一个与预测概率分布相关的有界矩阵。也就是说,F(x)的谱范数被Lipschitz常数的平方所控制,但F(x)额外融入了模型置信度的信息,是一个更精细的度量。
对于CLEVER分数,当模型对预测类别非常确信(p(c|x)≈1)时,F(x)的谱范数近似等于e^(-g(x))·‖?g(x)‖??,其中g(x)是真实类别与预测类别之间的logit差,‖?g(x)‖?正是CLEVER分数所估计的量(公式38)。也就是说,CLEVER分数是F(x)谱范数在高置信度极限下的一个近似成分。
对于随机平滑算法(一种通过给输入加高斯噪声来认证模型稳健性半径的方法),团队推导出随机平滑的认证半径r的期望满足E[r] ≤ (√(2π)σ?/4)·‖F(x)‖?^(1/2)(公式39)。这意味着F(x)的谱范数给出了认证半径期望的上界:F(x)谱范数越大,最大可认证的安全半径越小,两者的关系是反向的。
这三个关系共同说明了这套框架的"统一"性质:它从信息几何的视角,将Lipschitz常数、CLEVER分数和随机平滑认证半径这些看似独立的工具,统一到同一个数学结构下,并提供了比任何单一工具都更全面的视角。
---
说到底,这项研究做的事情用一句话概括就是:给AI的脆弱性安了一台"内置地震仪",不需要等地震来了才知道危险,只需要在地面上放好仪器,持续读数就够了。这台地震仪有坚实的物理理论支撑,有多种精度和速度权衡的读取方式,而且既能在知道地下构造(白盒)的情况下工作,也能在完全不知道(黑盒)的情况下给出方向性的参考。
当然,这台地震仪也有自身的局限性。它的读数会受到数据分布的影响,所以跨数据集的比较需要谨慎解读。对于体量极为庞大的模型(比如数十亿参数的大语言模型),计算成本依然不可小觑。此外,目前这套框架只适用于有明确概率输出的分类任务,如何推广到回归或生成式任务,仍是有待解决的开放问题。研究团队也坦承,将这套方法应用到RobustBench等标准排行榜上的最先进对抗训练模型(如WRN-34-10、ConvNeXt)是一个重要的未来方向,有望为这些顶尖模型的内在稳健性提供全新的诊断视角。
感兴趣的读者可以通过arXiv编号arXiv:2606.04767获取完整论文,代码也已开源在GitHub(github.com/franz-chang/SRP/),可以直接下载运行。
---
Q&A
Q1:费舍尔信息矩阵谱范数和PGD、CW这些攻击指标有什么本质区别?
A:PGD和CW是通过实际发动攻击来测量模型被攻破的难度,每次测试都需要大量计算,而且换一种攻击方式结果可能完全不同。费舍尔信息矩阵谱范数是从模型内部出发,衡量输出概率分布对输入扰动的固有敏感性,不依赖任何特定攻击手法。两者回答的问题不同:攻击指标说的是"用这种方法能不能打赢",谱范数说的是"这个模型本质上有多容易被摇动",是互补关系而非替代关系。
Q2:Hutchinson算法在估计费舍尔信息矩阵谱范数时为什么要用Λ^(1/2)Q?QΛ^(1/2)而不直接用原矩阵?
A:费舍尔信息矩阵F(x)的维度是输入像素数d乘以d,对一张常规图片来说是十几万乘以十几万,随机向量在这么高维的空间里与特定方向对齐的概率会随维度指数级下降,导致Hutchinson估计几乎无效(误差接近100%)。而Λ^(1/2)Q?QΛ^(1/2)是K乘以K的矩阵,K只是类别数(通常10到1000),维度大幅降低,随机向量更容易对齐,误差从约99.8%降到10%至60%量级,估计有意义得多。
Q3:这套方法在实际部署AI系统时能怎么用?
A:最直接的用途是在部署前做"稳健性体检",不需要真的发动攻击就能初步判断模型的内在风险等级。其次是在多个候选模型中进行横向比较,帮助选出本质上更稳健的架构,例如在医疗影像或自动驾驶这类高风险场景中,可以优先筛选谱范数较小的模型。此外,在模型设计阶段,理论上界分析(如DenseNet的谱范数上界最大)可以指导架构选择,避免引入内在脆弱性高的设计模式。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。