微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 墨尔本大学发现了一个让AI"换眼看世界"时不再迷路的新方法

墨尔本大学发现了一个让AI"换眼看世界"时不再迷路的新方法

2026-08-06 16:27
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-06 16:27 科技行者

这项由澳大利亚墨尔本大学研究团队完成的研究,以预印本形式发布于2026年7月24日,论文编号为arXiv:2607.22117,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

一、当AI换了"视角"就认不出猫了

假设你从小在上海长大,见过的猫都是在公寓里、用手机拍的照片里那种。有一天你去了一个非洲草原,当地摄像头拍出来的猫照片颜色偏黄、画质粗糙、角度奇怪。你能认出来那是猫吗?当然能,因为你脑子里有"猫的本质特征"——四条腿、尖耳朵、胡须,不管背景、光线、相机怎么变,这些核心特征都在。

然而现在的深度学习模型就没有这种能力。它们在某一类照片上训练得再好,换了另一类风格的图片往往就翻车了。这个问题在AI研究里叫做"领域泛化"(Domain Generalization,简称DG)——怎么让模型学到那些"不管换了哪个领域都管用"的核心知识,而不只是记住某种风格的表面特征。

墨尔本大学的研究团队正是奔着解决这个问题去的。他们在一种叫做"CPCANet"的已有方法基础上,发现了一个关键缺陷,并提出了名为"PP-CPCANet"的改进框架,在四个标准测试集上都取得了当前最优的表现。

二、原来的方法卡在了哪里

在解释新方法之前,先要理解旧方法的问题所在,否则就像看不懂剧情背景的续集,总觉得少了些什么。

CPCANet的核心思想来自一个叫做"公共主成分分析"(Common Principal Component Analysis,CPCA)的统计工具。这个工具的哲学很朴素:不同领域的数据虽然看起来千差万别,但如果你找到一个特殊的观察角度,从这个角度看所有领域的数据,它们的结构都会非常相似。这个"特殊观察角度"就是所谓的公共主成分。

可以用一个比喻来理解这件事。你有一批用不同语言写的菜谱,中文的、法文的、日文的,文字完全不同。但如果你把所有菜谱都翻译成"食材+烹饪动作"这种通用符号系统,所有菜谱的底层结构就会浮现出来——切、炒、煮、烤,这些动作是跨语言共通的。CPCA干的就是这件事:找到那套"通用符号系统",让来自不同领域的数据都能在同一个坐标系下被比较。

CPCANet把这个工具嵌入了深度神经网络,让模型在训练时自动寻找这种跨领域共通的结构。这个思路本身是合理的,但它有一个致命的工程缺陷——它依赖的是对每一批训练数据计算"协方差矩阵"(可以理解为衡量数据各个维度之间关联程度的一张表)。

问题就出在这张表上。现代深度学习模型的特征维度非常高,动辄几百上千维。但每次训练时,模型只处理一个"小批次"的数据,每个领域可能只有三十二个样本。这就像你想绘制一张一千个城市之间的完整道路关系图,但每次只能看到三十二个城市——你能画出来的图,注定是残缺的。统计学里把这个问题叫做"秩亏",通俗地说就是数据太少、维度太高,算出来的那张关系表根本不完整,里面丢失了大量有用的信息。

于是本文的核心使命就变得清晰了:能不能设计一种方法,完全绕开这张"协方差关系表",却依然能学到跨领域共通的结构?

三、新方法的核心思路:换一种角度找"共同语言"

PP-CPCANet的解法来自一个叫做"投影追踪"(Projection Pursuit,PP)的经典统计思想。与其费劲去计算那张不完整的关系表,不如直接问一个更简单的问题:存不存在某个方向,把数据往这个方向"投影"之后,数据会尽可能地分散开?

回到菜谱的比喻。与其详细分析每种语言里所有词汇之间的关联关系(这就是协方差矩阵在做的事),不如直接动手测试:换一种描述方式之后,不同菜谱之间的差异是不是更容易被看出来?如果换成"食材+烹饪动作"这套描述方式之后,菜谱之间的区分度最大,那这套描述方式就是我们想要的那个"投影方向"。

PP-CPCANet把这个思路嵌入了神经网络的训练过程,具体分成了几个精心设计的部件,相互配合,共同完成寻找跨领域共通结构的任务。

四、在"球面"上学习方向:Stiefel流形优化

PP-CPCANet的第一个核心设计是用一种特殊的方式存储和更新那个"投影方向"。

在数学里,"正交基"是一组互相垂直、互不干扰的参考方向,就像三维空间里的x轴、y轴、z轴。寻找公共主成分的本质,就是寻找这样一组正交基,让不同领域的数据在这组基下展现出最大的共同结构。

问题是,在训练神经网络时,参数会不断更新,如果任由这组正交基随意变化,它很可能就不正交了——方向们开始互相干扰,信息变得混乱冗余。为了保证这组基始终保持正交性,研究团队把它们约束在一个叫做"Stiefel流形"的数学空间上。

Stiefel流形听起来很高深,但本质上可以用球面来类比。地球表面上的所有点,无论你怎么走,都满足"距离球心1"的约束。类似地,Stiefel流形上的所有点(在这里每个"点"代表一组正交基),都满足"正交性"的约束。在这个曲面上行走,你永远不会离开约束范围。

具体的实现方式用到了一个叫做"Cayley变换"的数学工具。研究团队不直接优化那组正交基,而是优化一个没有任何约束的普通参数向量,然后通过Cayley变换,把这个普通向量确定性地映射为一个满足正交性的基。这样一来,整个神经网络的训练过程就可以正常进行,梯度该怎么算还是怎么算,但最终得到的投影方向永远是合法的正交基。更重要的是,这组基是"全局的"——它不是从某一个小批次数据里临时估算出来的,而是作为模型的一部分,在整个训练过程中持续更新、持续优化。这从根本上解决了协方差矩阵因为小批次数据不够而残缺不全的问题。

五、如何衡量"投影得好不好":打破对称的鲁棒散度

找到了如何保存和更新投影方向之后,还需要回答一个问题:怎么判断当前的投影方向好不好?换句话说,需要一个"评分标准",告诉模型哪个方向是值得追求的。

在投影追踪的框架里,评分标准通常是:投影之后数据越分散越好。道理很简单——如果把所有数据投影到某个方向之后,它们挤成一团,那说明这个方向没有提取到有价值的信息;反之,如果数据分散开来,说明这个方向捕捉到了数据中真正有区分度的结构。

但这里有一个微妙的数学陷阱。由于研究团队使用的是正交基,整体数据的总"散度"(分散程度)在任何正交变换下都是不变的——就好比把一桌散落的珠子装进一个不同形状的盒子,珠子的总数不会改变。这意味着如果用一个不加区分的评分标准,无论怎么旋转那组正交基,得分都一样,模型根本没有动力去优化方向。

为了打破这种"旋转不变性",研究团队引入了一个巧妙的设计:给不同的投影方向赋予不同的权重,越靠前的主方向权重越高(比如按照[最高维度, 次高维度, ..., 1]这样依次递减分配权重,再归一化),这样模型就有了明确的目标——把更多的信息集中到前几个主方向上,而不是均匀分散在所有方向。这个设计叫做"对称性破坏权重"。

另一个设计则针对异常数据的干扰。在不同领域的图像里,背景变化、光照变化、摄像头噪声都会产生一些"离群点"——和大多数数据很不一样的异常样本。传统的基于方差的评分标准对这些离群点非常敏感,一个极端值就能把整个方向带偏。

一种更稳健的替代方案是使用"中位绝对偏差"(MAD)——先算出所有数据点的中位数(中间那个值),再看每个点离这个中位数有多远,取所有这些距离的中位数作为散度指标。这个方法的好处是对少数极端值完全免疫,因为中位数本身就不受极端值影响。

但是,直接把中位数操作嵌入神经网络训练有个实际问题:中位数的计算是不光滑的,求导时会产生稀疏甚至为零的梯度,模型会频繁陷入无法更新的困境,训练极不稳定。

研究团队的解决方案是采用一种叫做"分离梯度中位数L1散度"的折中方案。具体做法是:先计算当前批次数据的中位数,但用一个特殊操作把它"冻住"——告诉模型"这个中位数值只是一个固定的参考锚点,不要对它求导"。然后计算每个数据点到这个固定锚点的L1距离(就是普通的绝对值距离),以这些距离的加权平均作为散度评分。

这样做的效果是两全其美的:中位数提供了对离群点免疫的鲁棒参考点,L1距离保证了梯度的密集性(几乎每个点都能提供有效的梯度信号),而冻住中位数的求导则消除了训练过程中的不稳定性。

六、整体架构:从粗到细的"信息漏斗"

把上述两个核心组件组装起来,就得到了PP-CPCANet的完整架构。

整个模型的工作流程可以用一个"信息漏斗"来理解。原始图像先经过一个预训练的主干网络(比如ResNet-50或者视觉Transformer),变成一组高维特征向量。然后这组特征进入PP-CPCANet的级联结构,经过逐级压缩和净化,最终产生用于分类的输出。

级联结构里有几个深度(研究发现单层效果最好,后面会详细说明),每个深度包含几个模块。首先是一个"瓶颈模块",把特征从高维压缩到较低维(按照"每层减半,最小不低于16维"的规则递减),这个压缩操作就像漏斗的收窄部分,强迫模型只保留最核心的信息。然后是Cayley变换正交投影,把压缩后的特征投影到当前学到的最优正交基上。投影结果一方面用于计算散度评分(指导模型学到好的投影方向),另一方面送入两个独立的多层感知机,分别预测一个"缩放因子"和一个"平移因子",用来调制上一层的特征——这部分来自原始CPCANet的"领域引导特征调制"设计,目的是让提取到的几何结构信息对整体特征产生实质影响。

整个训练目标是两部分之和:正常的分类损失(让模型把图片分对类别)加上PP散度损失的负值(让模型找到最大化散度的投影方向),两者之间用一个权重参数平衡,研究中设置为0.005。

七、实验结果:数字背后的真实意义

研究团队在四个标准的领域泛化测试集上验证了PP-CPCANet的效果,分别是PACS、VLCS、OfficeHome和TerraIncognita。

PACS包含约一万张图片,分属四个视觉风格迥异的领域:艺术画、卡通、照片和素描,共7个物体类别。这个测试集特别能考验模型对风格变化的适应能力。VLCS汇集了来自四个不同数据集的约一万张图片,包括5个共同类别,领域间的差异来自数据收集方式和场景背景的不同。OfficeHome包含约一万六千张图片,四个领域分别是艺术画、剪贴画、产品图和真实世界照片,共65个类别,类别数量多使得任务难度更高。TerraIncognita则包含约两万五千张野生动物图片,由不同地理位置的摄像陷阱拍摄,共10个动物类别,领域差异主要来自拍摄地点和环境光照的不同。

评估采用的是"留一法":每次把其中一个领域作为测试集(模拟未见过的目标领域),用剩余领域训练,最后对所有留出测试的结果求平均。

使用ResNet-50作为主干网络时,PP-CPCANet获得了69.2%的平均准确率。原始CPCANet在相同设置下为69.5%,略高于PP-CPCANet,但两者差距非常小(在统计误差范围内)。更重要的是,PP-CPCANet的显存占用从8.65GB降低到8.25GB,训练时间也略有缩短,实现了以更低的计算开销达到相近性能的效果。

当使用更强大的视觉状态空间模型VMamba-B作为主干网络时,PP-CPCANet的平均准确率达到77.2%,超过了同等设置下CPCANet-B的76.6%,成为所有评测方法中平均准确率最高的结果。相比之下,PP-CPCANet-B的显存需求是47.81GB,与CPCANet-B的47.42GB相近,训练时间也相差不大。

在基于视觉Transformer(DeiT)的骨干网络上,PP-CPCANet-B达到72.6%的平均准确率,与CPCANet-B的72.8%几乎持平,同样在显存和时间上略有优势。

从具体数据集来看,PP-CPCANet在TerraIncognita上的表现尤为值得关注。这个数据集的领域差异来自真实的地理位置变化,属于最贴近实际应用场景的测试。使用VMamba-B时,PP-CPCANet在TerraIncognita上达到57.7%,与CPCANet-B的57.7%完全持平,而在PACS上以92.9%对91.2%明显领先,在VLCS上以80.3%对79.6%略有优势。

八、结构设计的合理性:为什么一层就够了

研究团队专门做了一组消融实验,探索级联深度T和投影维度d1对性能的影响,结果相当有趣。

在固定投影维度d1=128的情况下,测试了T从1到6的效果。T=1时平均准确率为69.2%,T=2时降到68.3%,T=3时回升到68.8%,T=4到T=6都在68.3到68.6之间波动。换句话说,增加级联深度不仅没有帮助,反而普遍拖累了性能。

在固定T=1的情况下,测试了d1取32、64、128、256、512时的效果。最佳结果出现在d1=128,准确率69.2%;其余维度的结果分别是d1=32时69.0%、d1=64时68.9%、d1=256时68.8%、d1=512时68.7%。128维是一个甜蜜点:维度太低丢失了太多信息,维度太高则引入了过多噪声,都不利于提取干净的共通结构。

这个结果从侧面印证了PP-CPCANet的设计逻辑:鲁棒的散度指标本身已经足够高效,不需要通过堆叠多层来反复提炼信息。单层128维的投影就能在噪声抑制和表示能力之间取得最佳平衡。

说到底,PP-CPCANet解决的是一个非常实际的工程问题:当你的模型需要在"从来没见过的环境"里工作时,如何让它不迷路。旧方法聪明但有硬伤,新方法绕了个弯,用投影追踪代替协方差矩阵,再加上球面约束、分离梯度中位数、对称性破坏权重这几个精巧的辅助设计,最终不仅解决了数学上的缺陷,还在多个测试场景下实现了当前最优或相近最优的性能,而且计算开销更低。

对于普通人来说,这类研究意味着未来的AI系统在面对陌生场景时会更加可靠——无论是自动驾驶遇到没见过的城市路况,还是医疗AI面对来自不同医院、不同设备的图像,背后都需要这种"换了环境也能认出猫"的泛化能力。

PP-CPCANet目前还是一个研究原型,有兴趣追踪后续进展或深入了解技术细节的读者,可以通过arXiv编号2607.22117查阅完整论文,或持续关注墨尔本大学相关研究团队的后续工作。

Q&A

Q1:领域泛化问题在现实中有哪些具体应用场景?

A:领域泛化在现实中应用非常广泛。自动驾驶系统需要在不同城市、不同天气条件下都能正确识别行人和路标;医疗影像AI需要处理来自不同品牌设备、不同医院拍摄条件的图像;工业质检系统需要在更换生产线或照明条件后依然准确识别缺陷。这些场景的共同特点是:训练数据和实际使用时的数据存在分布差异,领域泛化技术正是为解决这类问题而生的。

Q2:PP-CPCANet相比原始CPCANet在计算成本上有多大改善?

A:根据论文数据,以ResNet-50为主干网络时,PP-CPCANet的显存占用约8.25GB,低于CPCANet的8.65GB;训练总时长约为16小时47分钟,与CPCANet的16小时49分钟相近甚至略短。以VMamba-B为主干时,PP-CPCANet约需47.81GB显存、4天11小时完成训练,与CPCANet-B的47.42GB和4天12小时基本持平。总体来说,在相近或更低计算开销下,PP-CPCANet取得了相当甚至更优的性能。

Q3:Cayley变换在PP-CPCANet中具体起什么作用?

A:Cayley变换是PP-CPCANet中保证正交基合法性的关键工具。在训练过程中,模型需要不断更新投影方向,但这些方向必须始终保持互相垂直(正交)。如果直接优化正交基,很难在每次更新后都维持正交约束。Cayley变换提供了一个优雅的解决方案:将一个无约束的普通参数向量先转换为反对称矩阵,再通过特定的矩阵运算确定性地映射为正交矩阵,从而让普通的梯度优化天然地在正交约束范围内进行,无需额外的约束处理步骤。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-