微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 GGSS:让AI看图说话时,不再因为你的肤色和性别给出不同答案

GGSS:让AI看图说话时,不再因为你的肤色和性别给出不同答案

2026-09-22 15:47
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-22 15:47 • 科技行者

先说一件让人有点不舒服的事。

你给一个AI视觉语言模型看两张照片,照片里的人穿着一样的衣服,摆着一样的姿势,唯一不同的是这个人的肤色。然后你问AI:"这个人的年薪大概是多少?"

结果AI给出了两个不一样的答案。

这不是假设,这是真实发生的事。随着ChatGPT这类多模态AI模型越来越多地被用在招聘筛选、教育评估这些"人生大事"的场景里,这种系统性的偏差就不只是一个学术问题了,它可能真的影响一个人能不能拿到面试机会。

日本Magellan技术研究所和新加坡国立大学的研究者们盯上了这个问题,他们提出了一套叫GGSS的方法,试图在不重新训练模型的前提下,让AI别再"看脸"说话。这篇论文最后被投到了arXiv上,编号2608.25375。

为什么这事儿比听起来更难

先搞清楚一个概念。

生成式视觉语言模型(VLM):能同时理解图片和文字,并生成自然语言回答的AI系统,比如你上传一张图问它"这是什么",它能用完整的句子回答你。

在这篇论文之前,行业里已经有一批"去偏见"的方法,但几乎都是给CLIP这类模型设计的。

CLIP:一种把图片和文字都压缩成一个向量(可以理解成一组数字)来表示的模型,图片和文字共享同一个"语义空间"。

CLIP的特点是简单粗暴:一张图,一个向量,搞定。但现在主流的生成式VLM完全不是这么工作的。一张图片进去,会被拆解成成百上千个"视觉token"(可以理解成图片被切成很多小块,每块变成一组数字),这些token会喂给一个类似ChatGPT的语言模型去做后续的理解和生成。

这个架构差异导致了一个尴尬的局面:把CLIP时代的去偏见方法直接搬到生成式VLM上,效果往往很差,甚至比什么都不做还糟糕。论文里的实验证明了这一点,某些老方法在新模型上表现被"unsteered baseline"(也就是完全不做任何干预的原始模型)反超。

研究者总结出了三个具体的坎。

第一个坎是几何保形的问题。VLM里的视觉token在进入语言模型之前,会经过一层投影层,这层的输出后续要被注意力机制和解码过程反复使用。如果你简单粗暴地做"欧几里得减法"(把一个方向向量直接从token里减掉),会同时破坏token的方向和长度,模型规模越大,这种破坏造成的质量下滑就越明显。

这里要理解一下为什么"长度"这么重要。

想象你在调一杯鸡尾酒,配方要求"1份朗姆酒+2份果汁",这个比例才是味道的关键,而不是这杯酒倒了多少毫升到杯子里。如果你为了减少某种味道,直接从杯子里舀掉一勺混合液体,你确实减少了那个味道,但整杯酒的浓度也跟着变了,配方比例全乱了。视觉token的"方向"就像是这个配方比例,承载着模型理解图片内容的关键信息,而"长度"(也就是数学上说的范数)代表这个信号的强度。如果去偏见操作把长度也搞乱了,模型后续所有基于这个信号强度做的判断都会跟着走偏,这就是为什么论文反复强调"norm-preserving"(保持范数不变)有多重要,如果不保这个范数,代价就是模型输出质量的整体塌方。

第二个坎叫token级别的偏见不均匀。一张脸部照片里,可能只有描述脸部特征、衣着这些token真正携带了"种族""性别"这类人口统计信号,剩下描述背景、姿势的token基本不携带这类信息。如果对所有token一刀切地做投影清洗,那些无辜的背景token也被强行"消毒"了,任务表现自然会跟着受损。

第三个坎叫单方向的僵化问题。很多老方法假设一个"受保护属性"只有两个类别(比如性别),只有一个"偏见方向"需要处理。但种族这类属性天然是多分类的,得用一个低维的子空间去建模,而不是一根孤零零的向量。

GGSS怎么解决这三个问题

GGSS的全称是"Geodesic-Gated Spherical Steering",翻译过来大致是"测地线门控球面转向"。

这名字听起来挺唬人,拆开看其实是三个核心设计的组合:先在一个球面上找出偏见藏在哪个方向,再用球面上的平滑旋转去纠偏,同时用一个"门"来决定每个token该被纠正多少。

**第一步:在单位球面上找偏见方向**

研究者的做法是收集一批"反事实图像",也就是同一个人、同一个姿势、同一套衣服,唯一变化的是种族或性别标签。这些图片来自公开数据集REFLECT/FOCUS,一共480张真实照片,覆盖6种职业、8个身份、5种感知种族、2种性别,而且每套图片是像素级对齐的,这样活动差异才能真正归因到那一个被改变的属性上,而不是被姿势、光线这些无关因素干扰。

把这些图片喂给模型,取出视觉token的激活值,做归一化(也就是把向量长度统一压缩到1),这样所有的向量点就都落在了一个数学上的球面上。

单位超球面:所有长度为1的向量构成的集合,可以想象成地球表面,所有点到地心的距离都一样,只是方向不同。

在这个球面上,研究者计算每个身份组的"球面均值"(也叫Fréchet均值,可以理解成球面版本的平均值),然后看变化种族标签会让这个点在球面上朝哪个方向"漂移"。把所有这些漂移方向收集起来做一次奇异值分解(SVD,一种从数据里提取主要方向的数学工具),就得到了一个多维的"偏见子空间",这个子空间捕捉的正是不同种族之间在模型内部表示上的系统性差异。

**第二步:用球面插值代替生硬投影**

传统方法在清除某个方向的信息时,通常是硬投影,直接把这个方向的成分从向量里砍掉。GGSS换了个思路,用了一种叫Slerp的技术。

Slerp(球面线性插值):一种沿着球面表面而不是直线,在两个点之间平滑过渡的插值方法,最早用于计算机图形学里做旋转动画。

这里的关键洞察是,如果你把token的方向想象成地球表面的一个点,硬投影相当于直接把这个点"拽"到目标位置,走的是穿过地心的直线捷径,这条路径根本不在地球表面上。而Slerp走的是地球表面本身的那条弧线,也就是所谓的测地线,全程贴着球面走,终点的向量长度自然还是1,完全不需要额外去"修复"。

这就是为什么这个方法叫"geodesic"(测地线),因为它坚持沿着球面的自然路径去移动,而不是抄近道破坏几何结构。

**第三步:给每个token装一个"油门"**

即便找到了偏见方向,也不该对每个token都用同样力道去纠正。GGSS引入了一个自适应门控机制,先算出每个token在偏见方向上的投影大小,再拿这个值跟"发现阶段"统计出来的中位数、标准差做比较,通过一个sigmoid函数把这个比较结果转换成一个0到1之间的门控值。

如果一个token本来就没什么偏见成分,这个门就基本关着,token几乎不被动;如果一个token偏见成分特别重(比如正好落在脸部区域),门就开得很大,纠正力度也跟着拉满。

这里可以想一个类比。假设你是一个安检员,站在机场安检口,每天有成千上万的乘客经过。如果你对每个人都用同样严格的流程搜查,那效率会低到崩溃,而且大部分乘客根本没带任何违禁品,白白折腾。真正靠谱的做法是先用一个初步扫描仪快速判断谁的行李里信号异常,只对信号强的人加大检查力度,信号弱的直接放行。如果没有这个筛选机制,安检口的效率会崩、乘客的正常物品也会被过度盘查、误伤概率飙升。GGSS的门控做的就是这件事:只对携带了强烈偏见信号的token下重手,对携带正常视觉信息的token放行,这直接决定了这个方法既能纠偏又不会把模型整体能力拖下水。

这套设计还有一个数学上的保证,论文里给出了证明:只要目标方向不是当前方向的正对面(数学上叫"对径点"),最终这套操作严格保持token的原始长度不变。这不是经验观察,是可以证明的定理。

实验结果:四个模型,全部拿下最低偏见值

研究者选了四个不同规模的生成式VLM来测试:参数量最大的是Pixtral-12B(120亿参数),另外三个是LLaVA-1.6的Vicuna版和Mistral版(各70亿参数),还有Qwen3-VL-4B(40亿参数)。

评测用了三套偏见测试和一套能力保留测试。

第一套叫MCQ,问模型一个关于薪资或教育的多选题,然后看不同种族版本的图片下答案分布差异有多大,用JS散度(一种衡量两个概率分布差异程度的统计指标)来量化,数值越低说明种族之间的答案越一致,也就是越公平。

第二套叫2AFC,让模型在两张同一个人不同种族版本的照片里选"谁收入更高",理想情况下这应该是随机猜的,任何系统性偏好都说明模型在用种族做判断。

第三套是Nurse/Doctor测试,让模型判断护士和医生照片里的性别,看模型对"男性=医生""女性=护士"这类刻板印象的依赖程度。

最后一套是MMStar,一个包含1500道多选题的综合能力测试,涵盖粗粒度感知、细粒度感知、逻辑推理等六个维度,用来确认去偏见操作没有把模型的正常智力也一起削没了。

在这四个模型上,GGSS对比了十种从CLIP时代和语言模型时代"移植"过来的基线方法,包括INLP(迭代零空间投影)、分类器引导的均值偏移方法、BendVLM(一种检索式的均衡化方法)、以及LEACE(一种闭式解的概念抹除方法)。

结果是这样的:

在Pixtral-12B上,GGSS的平均偏见降低幅度是55%,同类最强的对手BendVLM(欧式版本)只做到了37%。

在LLaVA-1.6-Vicuna-7B上,GGSS做到90%的降幅,最强对手INLP(球面版本)是86%。

在LLaVA-1.6-Mistral-7B上,GGSS是80%,对手是78%。

在Qwen3-VL-4B上,GGSS是60%,对手是49%。

具体到单项任务,GGSS在Nurse/Doctor测试上把偏见砍掉了96%(从0.600降到0.025),在MCQ测试上砍掉84%,在2AFC测试上砍掉61%。

更关键的是,这些降幅几乎没有牺牲模型的正常能力。MMStar的分数变化控制在正负0.6个百分点以内,这个波动幅度基本可以归为统计噪声。研究者还专门跑了统计显著性检验,用了自助法(bootstrap,一种通过重复抽样估计不确定性的统计方法)和配对置换检验,结果显示GGSS在四个模型里的三个上,偏见降幅是统计显著的,而且在全部八次MMStar测试里,跟未干预的原始模型相比都没有显著差异。

对比之下,表现最强的竞品INLP(球面版)虽然偏见降得也不错,但代价是显著拖累了Pixtral模型的MMStar分数,降了6.1个百分点,这个差异在统计上是非常显著的。还有一个基线方法BendVLM的球面版本,在某些模型上直接把生成能力搞崩了,产生的答案完全无法解析,这也印证了论文一开头就强调的那句话:把CLIP时代的方法生搬硬套到生成式VLM上是有风险的。

去偏见不是把人"抹除"

这里有个很重要的问题需要澄清:如果一个方法能把模型对种族、性别的判断差异抹平,会不会顺便把模型识别种族、性别本身的能力也一起抹掉了?

这其实是个很实际的顾虑。如果一个护士要求AI系统帮忙做病历记录,里面确实需要准确记录病人的性别信息,这时候你肯定不希望AI因为"去偏见"过度而连基本的人脸识别都失灵。

研究者专门做了测试来验证这一点。结果显示,当针对种族做纠偏时,模型对性别的识别能力完全没受影响;反过来针对性别纠偏时,种族识别能力也保持完好。这说明GGSS的干预是有针对性的,不是一竿子打死所有人口统计信号。

不过这里有个需要权衡的地方,纠偏力度(论文里用α这个参数控制)调得越大,目标属性本身的可识别度也会跟着下降。在Qwen3-VL模型上,当α调到论文报告的最优值时,模型识别种族的准确率从80%掉到了20%,这确实说明力度拉满时,模型对这个属性的感知被大幅削弱了。但如果把α调低到中间值,纠偏效果已经能实现一半以上(MCQ偏见降低55%),种族识别准确率却基本保持在76%,几乎没有损失。

这就像调节浴室里的水温旋钮。你完全可以把水龙头拧到最热或者关到最冷这两个极端,但真正好用的方式是找到那个中间点,既能洗到舒服的温度,又不会烫伤自己。如果系统只提供"全开"或者"全关"两个选项,没有中间调节的空间,那真正需要热水洗澡的人和怕烫的人就只能有一个能满意。α参数存在的意义正在于此,它把"完全不管"和"完全抹除"这两个极端之间,变成了一条可以自由挑选停靠点的连续曲线,不同任务可以根据自己的实际需求,选择靠近哪一端。

几个容易被忽略但很关键的细节

论文里还藏着一些很值得琢磨的实验设计。

一个是关于"发现阶段用的提示词是否会影响结果"的验证。研究者担心用来发现偏见方向的那句指令(比如"详细描述这张图片")本身会不会带偏后续的判断。他们换了四种完全不同的提示词重新跑了一遍发现流程,结果找到的偏见子空间几乎完全一致,主角度余弦值达到0.9997以上,说明这套方法的稳健性很高,跟具体用什么提示词去"钓"出偏见方向没什么关系。这个结果背后的原因其实很直接:视觉token的激活值是在文字提示介入之前就已经计算好的,架构上就决定了提示词根本插不上手。

另一个值得注意的地方是消融实验(也就是把方法拆开,一块一块地看每个组件到底贡献了多少)。研究者发现,如果只用门控但不用球面插值,偏见能降69%;如果只用球面插值但关掉门控(相当于门永远全开),效果反而比不装门控还差一些;只有把门控和球面插值这两个组件同时用上,才能达到84%的最佳效果。这说明这两个设计不是简单叠加,而是相互配合才能发挥最大威力。

还有一点很诚实的地方是,研究者专门做了一个"held-out"(留出集)验证,把测试身份分成两组,用一组数据去选参数,在另一组完全没见过的数据上验证效果,结果显示八次交叉验证里有六次选出的最优参数跟论文报告的完全一致,剩下两次也在每个折叠上都实现了偏见的实际降低。这种做法算是给结果的可信度上了一道保险,避免了那种"在测试集上调参调出来的虚高分数"的嫌疑。

写在后面

读完这篇论文,最让我意外的一点是那个球面几何的选择,一开始我以为这只是个数学上的美化,直到看到消融实验里那句话:在120亿参数的Pixtral上,欧式版本的方法会显著损伤模型能力,而球面版本在所有规模上都稳如老狗。这说明保持向量长度不变这件事,并不是一个无关紧要的技术细节,而是随着模型变大会越来越要命的问题。小模型上你怎么折腾都还凑合,但模型一旦做大,任何几何上的粗暴操作都会被放大成实实在在的性能塌方。这提示了一个更普遍的教训:很多在小规模实验里看起来无关紧要的设计选择,换到大模型上可能会突然变得致命,这种"规模依赖的脆弱性"恐怕值得整个领域更认真地对待。

另一个让我反复琢磨的地方是那个门控机制里藏着的价值判断。研究者选择用中位数和标准差去校准每个token该被纠正多少,这本质上是在说:偏见不是均匀分布在图片的每一个像素上的,它高度集中在脸部、衣着这些携带人口统计信息的区域,而背景、姿势这些区域基本是"无辜"的。这个假设听起来理所当然,但换个角度想,如果哪天有人拿这套框架去处理别的类型的偏见,比如政治倾向、宗教信仰,这些偏见的空间分布特征会不会完全不一样?论文的伦理声明部分其实也提到了这个可能性,说这套子空间构造方法或许能扩展到政治倾向这类非人口统计学的偏见轴上,这个方向如果真的被后续研究跟进,会是一件很有意思的事。

论文自己也很坦白地承认了局限,说这套方法目前只覆盖了感知种族和性别这两个维度,没有涉及交叉身份(比如同时考虑种族加性别的组合效应)、多语言场景、开放式使用场景。而且α这个参数还是需要人工去调,没有一个不依赖调参就能自动确定强度的规则。这种坦白反而让人觉得这篇论文更可信,它没有把自己包装成一个终点,更像是给这个方向立了一根桩子,告诉后来者:球面几何和自适应门控这两个思路值得继续往下挖。

如果哪天你的简历筛选系统、招聘面试助手背后跑的正是某个生成式VLM,你会不会想知道,它在看到你的照片时,到底有没有偷偷把你的肤色也算进了打分公式里?

Q&A

Q1:GGSS是什么?

A:GGSS是一种给生成式视觉语言模型做推理阶段去偏见的方法,全称是测地线门控球面转向,核心思路是在球面几何空间里找出偏见方向,用平滑的球面插值来纠正,同时用自适应门控只对携带强烈偏见信号的视觉token下手,不影响其他正常信息。

Q2:GGSS会不会把模型识别人的种族、性别的能力也一起削没?

A:不会完全抹除,实验显示针对种族纠偏时模型的性别识别能力基本不受影响,反过来也是如此。纠偏力度参数调得越大,目标属性的可识别度确实会下降,但研究者也给出了折中方案,中等力度下已经能实现一半以上的偏见降低,同时保留大部分的属性识别能力。

Q3:GGSS和之前的去偏见方法比效果怎么样?

A:在四个不同规模的生成式视觉语言模型上,GGSS的平均偏见降低幅度都是所有对比方法里最低的,其中三个模型上的降幅在统计上是显著的,而且模型的综合能力测试分数几乎没有受到影响,波动控制在正负0.6个百分点以内。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-