微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当医学影像的分割模型遇到一张陌生的胸片,它给出的答案往往漏洞百出。这不是因为模型不够聪明,而是因为它压根没见过这种图。

当医学影像的分割模型遇到一张陌生的胸片,它给出的答案往往漏洞百出。这不是因为模型不够聪明,而是因为它压根没见过这种图。

2026-10-09 11:21
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-10-09 11:21 • 科技行者

你有没有想过一件事:训练一个能识别任意物体的AI模型,到底需要多少标注数据?

答案通常是:海量的、像素级精确的标注。一张图片里的每一个像素都要被人工标记成某个类别,医生标注CT影像要花几个小时,遥感专家标注卫星图要对着地物边界一点点抠。这种标注工作又贵又慢,还要求标注者具备专业知识。

这篇论文要解决的,正是这个让人头疼的问题。

**核心问题:专业领域里,AI分割模型为什么会"水土不服"**

先说清楚我们在聊什么。

**开放词汇语义分割**:一种AI技术,能够根据你输入的任意文字描述(比如"猫""裂缝""肿瘤"),在图片里把对应的区域一个像素一个像素地标出来。

这类模型的底层技术通常基于CLIP,一种把图片和文字放进同一个语义空间里对齐的视觉语言模型。你告诉它"这是一只猫",它就能在海量图片里找到猫的样子,甚至是它从来没见过的猫的品种。这种能力在日常场景里表现得相当惊艳,比如识别街景里的车辆、行人、建筑。

但当这些模型被拉到医学影像、卫星遥感、工业质检这些专业领域时,问题就来了。论文里给出的数据非常直观:在医学影像领域,一个叫CAT-Seg-L的模型,零样本情况下的mIoU(一种衡量分割准确度的指标,数值越高说明预测区域和真实区域重合度越高)只有29.52。什么概念?满分是100,不到30分意味着大部分像素都判断错了。

为什么会这样?专业领域的图像和网络上那些猫猫狗狗、街景照片长得完全不一样。医学影像里血管和背景的边界模糊不清,卫星图里稻田和杂草的纹理相似到肉眼都要仔细分辨,工业场景里的裂缝、腐蚀这些概念,CLIP在预训练时几乎没见过对应的文字描述和图像配对。

传统的解决方案是什么?收集专业领域的图片,请专家标注每个像素属于哪个类别,然后用这些标注数据微调模型。这个思路没问题,只是代价太大。研究者们意识到,这个瓶颈可能根本不需要用"更多标注"去解决,而是应该换一种监督信号。

**发现的转机:提示词的"分歧",原来是个宝藏**

研究团队观察到一个有意思的现象。

同一张图片,同一个类别名称,你只要换一个提示词模板,模型给出的分割结果就会明显不同。比如"a photo of a cat"和"there is a cat in the scene"这两句话,语义上几乎一样,但喂给模型后产生的分割掩码可能差异很大。

**提示词分歧**:不同的提示词模板对同一张图片、同一个目标类别产生系统性不同的分割结果,这种现象在论文里被专门命名并加以利用。

论文里有张图特别能说明问题。研究者只改变提示词模板,在不同专业领域上测试同一个模型的验证集mIoU,结果发现分数上下浮动的范围相当大。换句话说,光是换个问法,模型表现就能天差地别。

大多数人看到这种"不稳定",第一反应可能是这是个缺陷,得想办法消除它。但这篇论文的作者反其道而行之:既然不同提示词会产生不同的候选答案,那这些候选答案之间的差异,不就正好可以当作一种天然的对比素材吗?

这就好比你去问三个不同的朋友同一个问题,他们给出的答案不完全一样。你不需要一个"绝对正确"的标准答案,你只需要知道,在这三个回答里,哪个更接近你想要的意思。这种"选择"比"从零开始写出完整答案"要容易得多,也便宜得多。

如果没有这个转念,研究者可能还在死磕怎么获取更多的专家标注,成本降不下来。而这个转念的关键在于,他们把"提示词导致的不确定性"从噪声重新定义成了信号来源。

**方法核心:把"选择题"做对,而不是"填空题"**

顺着这个思路,论文提出了一套完整的框架,核心逻辑是:让人类只需要做一道"选择题",而不是"填空题"。

具体怎么操作?整个流程分成三步。

第一步,找到最值得问的地方。给定一张训练图片,模型用14种不同的提示词模板分别生成14张分割预测图。这14张图在大多数区域可能是高度一致的,但在某些区域会出现明显分歧。研究者用信息熵这个数学工具,衡量每个像素上14个预测结果的"混乱程度"。

**信息熵**:一种衡量不确定性的数值,如果14个模板在某个像素上给出完全一致的判断,熵值很低;如果判断五花八门,熵值就高。

系统会找出熵值最高的区域,也就是模型们"吵得最凶"的地方,圈出一个局部小方框,这就是要拿去问人的区域。这一步很关键,因为如果拿整张图去问"你更喜欢哪个版本",两张图可能各有优劣,答案会很模糊。但如果把范围收窄到一个具体的小区域,问题就变得清晰了:"在这个方框里,A和B哪个更接近你想要的效果?"

这里有个类比或许更贴切。想象你请两个装修师傅来评估一套房子,师傅A说客厅不错但厨房有问题,师傅B说厨房没问题但客厅采光差。你没法简单地问"你更喜欢哪个师傅的整体判断",因为他们各有对错。但如果你只盯着厨房这一块地方问,答案立刻就清楚了。这个框架做的正是把模糊的"整体优劣"问题,切成了一个个具体的、有明确答案的局部问题。如果不做这一步局部定位,直接问整图哪个更好,标注者会陷入两难,给出的偏好信号会很不稳定,模型学到的东西也会很混乱。

第二步,在选定的方框内,从14个模板预测中找出分歧最大的那一对,让一个"裁判"(可以是人,也可以是论文里用来做大规模实验的自动化oracle)判断哪一个更准。这个判断结果只有两种可能:A赢,或者B赢,没有中间地带。

第三步,也是整个方法的技术核心,叫做区域局部化偏好优化。

**RLPO**:全称Region-Localized Preference Optimization,一种让模型从"哪个更好"这种二元判断中学习的训练方法,只对被选中的局部区域生效。

这个设计借鉴了一个在语言模型对齐领域很有名的技术,叫DPO。

**DPO**:全称Direct Preference Optimization,直接偏好优化,最早用于让语言模型的输出更符合人类偏好,核心思路是让模型对"胜出的答案"更自信,对"落败的答案"更不自信,不需要额外训练一个打分模型。

RLPO把这个思路搬到了图像分割上,但做了关键改造:DPO原本是对整段文字的生成概率打分,RLPO则是对被选中的局部区域内每个像素的分割置信度打分,还引入了按类别加权平均的机制,防止某个占据大片区域的类别把小而重要的类别的贡献淹没掉。

这个加权设计也值得说一说。如果一块区域里90%都是背景,10%是你真正关心的病灶,简单粗暴地按像素平均分数,背景的信号会完全压过病灶。RLPO按类别先分别算平均,再把各个类别的平均值汇总,这样无论目标物体占多大面积,它的声音都不会被淹没。这就好比开会投票,如果按人头数直接算,人多的部门永远说了算,但如果先按部门算出平均意见,再综合各部门意见,小部门的声音才不会被完全无视。

除了这个核心损失函数,团队还加了一道"保险",叫一致性正则化。

**一致性正则化**:在偏好优化只更新方框内区域的情况下,用来约束方框外区域的预测不要跟着乱漂移的额外约束项,具体做法是把"赢的那个预测"当作方框外高置信度像素的伪标签,去校正"输的那个预测"。

为什么需要这道保险?因为RLPO的更新只发生在被选中的那个小方框里,方框外的区域完全没有被直接监督。如果不加以约束,模型可能会在优化局部区域的同时,无意中让方框外的预测跑偏。这就好比你请工人只装修客厅,结果他为了赶工,把厨房的水管也顺手改了,改坏了都没人发现。一致性正则化相当于告诉工人:客厅随便你怎么改,但厨房必须保持原样,不许连带乱动。

**实验结果:不需要专家标注,也能打平专家标注**

方法讲完了,效果到底怎么样?

论文在MESS基准上做了大量实验,这是一个专门用来考验开放词汇分割模型在专业领域表现的测试集,覆盖通用场景、地球遥感监测、医学科学、工程检测、农业与生物学五大类,一共十几个具体数据集。

**MESS基准**:Multi-Domain Evaluation of Zero-shot Semantic Segmentation的缩写,一套专门用于评估分割模型在多个专业领域零样本表现的基准测试集合。

结果相当亮眼。四个不同规模的骨干模型,SAN-B、CAT-Seg-B、SAN-L、CAT-Seg-L,用了这套方法后平均mIoU分别提升了7.10、6.55、6.59、10.62个百分点。医学科学这个领域提升幅度最大,SAN-B从33.51涨到52.97,CAT-Seg-L从29.52涨到51.83,几乎翻了一倍。更让人意外的是,在部分数据集上,只用二元偏好训练出来的模型,效果反而超过了用真实像素级掩码训练的对照组。

这组数字意味着什么?意味着在某些专业场景里,让人回答"这两个方框哪个更准"这种简单问题,得到的效果不比让专家一笔一划画出准确边界差,甚至更好。这背后的原因大概是,逐像素标注本身也存在标注者疲劳、边界模糊导致的主观误差,而局部二选一的判断反而更稳定、更容易做对。

论文还做了一系列消融实验,验证每个设计的必要性。比如对比了三种候选生成方式:随机丢弃神经元制造扰动的MC Dropout、对图片做翻转缩放的测试时增强、以及本文用的提示词分歧。结果是提示词分歧拿到了45.88的平均mIoU,明显高于MC Dropout的39.09和测试时增强的44.66。原因在于,提示词分歧产生的候选预测,虽然分割结果不同,但针对的是同一套目标词汇,可以直接放在一起比较;而图像扰动会改变画面内容本身,两个候选可能已经不是在回答同一个问题了。

损失函数的消融也很说明问题。去掉RLPO这个核心损失,平均mIoU从45.88跌到40.51,掉了5.37个点;去掉一致性正则化,跌到43.45,掉了2.43个点。这说明RLPO是这套方法的主引擎,一致性正则化是辅助的安全带,两者缺一不可但重要性不同。

关于需要多少张图片才能看到效果,论文给出了从4张到128张的对比。医学科学领域只用4张图就能拿到11.51个点的提升,64张图左右趋于饱和;工程检测领域则需要更多图片才能把潜力压榨出来,128张时还在涨。不同领域的"学习曲线"不一样,这提示我们,这套方法在数据极度稀缺的场景里格外划算。

**稳健性:即便标注者会犯错,方法依然管用**

真实世界里,人类标注者难免会看走眼,把B错标成A。论文专门测试了这种情况,故意以一定概率翻转偏好标签,模拟标注错误。

结果显示,即便有20%的标签被故意翻转,模型依然能从零样本基线的35.26提升到大约43左右,只比干净标签下的45.88低了不到3个点。而且提升幅度最大的医学和工程领域,在噪声环境下依然保持了最大的收益。

研究团队还专门找了20个人做了一次人类标注实验,把偏好对按照两个候选之间的重合度差距分成简单、中等、困难三档。结果人类和自动化裁判的整体一致率达到92%,简单和中等档位接近满分,困难档位(也就是两个候选本身就很接近的时候)一致率降到84%。这其实是合理的,当两个答案本来就差不多好的时候,人的判断出现分歧才是正常现象,而不是错误。

针对这种"人类和裁判在困难样本上意见不一"的情况,论文还专门做了压力测试,只在这些高难度、边界模糊的样本上注入噪声,甚至故意反转标签。结果表明,即使是最极端的对抗性设置,模型平均分依然能维持在42分以上,远高于零样本基线的35.26。

**局限性:这套方法不是万能的**

论文也很坦诚地指出了短板。

这套方法有一个前提假设:目标词汇能够被自然语言合理描述,并且提示词产生的候选里至少有一个是靠谱的。如果所有提示词模板给出的预测都同样离谱,那"选一个更不那么错的"这种偏好信号,实际上提供不了多少有用的指导。

这种情况最可能出现在术语高度专业化、视觉表现形式跟日常图片差异极大的领域,自然语言模板本身就很难描述清楚目标是什么。论文提出,未来可以探索用学习得到的、领域专属的、甚至专家提供的提示词模板,来扩展这套偏好引导的适配思路。

写在后面

读完这篇论文,最让我意外的一点是,研究者没有去"修复"提示词敏感这个众所周知的CLIP系模型的老毛病,而是直接把它当作免费资源用了起来。这种思路转换其实挺值得琢磨的:很多时候我们花大力气想消除一个系统的"不稳定性",但换个角度看,这种不稳定性本身可能就蕴含着信息量,只是我们没找到提取它的办法。

另一个细节值得单独说一说:论文里医学领域提升最猛,只用4张图就能涨11个点。这说明当基线模型烂到一定程度时,哪怕是很粗糙的偏好信号,都能带来立竿见影的改善。这也许暗示了一个更普遍的规律,模型越是"水土不服",越容易从简单反馈里获益,因为它离及格线太远,随便一个方向的推力都是净收益。

至于人类和自动裁判在困难样本上只有84%一致率这件事,我倒觉得这不是方法的瑕疵,反而暴露了一个更本质的问题:当两个候选答案客观上都不算差的时候,"哪个更好"这个问题本身可能就没有唯一正确答案。这跟我们评价很多主观任务是一个道理,问题不在于评判标准不够精确,而在于世界本身在那个点上就是模糊的。

那么下一个问题来了:如果连人类自己都在困难样本上说不清楚谁对谁错,我们又该拿什么标准,去判断一个AI模型的分割结果"足够好"了呢?

Q&A

Q1:开放词汇语义分割是什么?

A:一种AI技术,能根据你输入的任意文字描述,在图片里把对应区域一个像素一个像素地精确标出来,包括训练时从未见过的类别。

Q2:这篇论文提出的方法为什么不需要专家标注像素级掩码?

A:因为它利用了不同提示词模板对同一张图产生的分割分歧,让标注者只需在局部区域里做"哪个更准"的二选一判断,而不是逐像素画出准确边界。

Q3:这套偏好引导的方法在噪声标签下还管用吗?

A:管用。即便20%的偏好标签被故意翻转,模型平均表现依然比零样本基线高出约8个百分点,说明该方法对标注错误有较强的容忍度。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-