
病理科医生在显微镜下看细胞的时候,经常会遇到这样的画面:好几个细胞挤在一起,边界互相渗透,你分不清这一块组织到底属于哪个细胞。
这不是显微镜没对好焦,也不是染色出了问题。这是细胞本身的物理特性决定的。
很多细胞是半透明的。当两个细胞叠在一起,重叠区域看到的不是"细胞A挡住了细胞B"这种干净利落的遮挡,而是两个细胞的信号混在了一起,你中有我,我中有你。这跟我们平时理解的"遮挡"完全是两回事。
想象你在拍一张桌子上放着两本书的照片,一本压着另一本,被压住的那本书,看不见的部分就是真的看不见,黑乎乎一片,没有任何信息。这是自然图像里的遮挡逻辑:挡住了就是挡住了,视觉证据直接消失。但细胞不是这样。细胞更像是两片彩色玻璃纸叠在一起,重叠的区域你能看到,但看到的是两种颜色混合之后的样子,说不清哪部分证据属于哪张纸。这种"证据混合"而不是"证据消失"的特性,让传统的遮挡处理方法在细胞图像上直接失效。
这篇来自塔尔图大学和乌克兰天主教大学团队的论文,就是奔着这个问题去的。他们提出的方法叫QCell,一个专门处理重叠细胞实例分割的模型。
细胞分割难在哪
要理解QCell的价值,得先明白现有方法卡在了什么地方。
细胞实例分割*:把一张显微镜图像里的每一个细胞单独标记出来,画出各自的完整边界,这个任务叫实例分割。
在QCell出现之前,处理重叠细胞主要靠三条路。
第一条路是局部区域分解,代表方法是DoNet。它的思路是把细胞聚集的区域切成一个个小方块(专业说法叫RoI,感兴趣区域),在每个小方块里单独判断哪部分是重叠区域、哪部分是独有区域,然后再把结果拼回去。这个思路挺直觉,但问题是它只能在小方块内部看信息,没法跳出这个方块去看整张图上其他细胞长什么样。
第二条路是形状先验,让模型提前学一套"细胞应该长什么形状"的经验,遇到被遮挡的部分就按照这套先验去补全。这在自然图像里(比如猫、车、人这些形状比较固定的物体)效果不错,但细胞的形态变化太大了,同一种细胞在不同状态下可以完全长得不一样,硬套一个形状模板反而会出错。
第三条路是生成式补全,用扩散模型直接"画"出被遮挡的部分应该长什么样。这类方法效果惊艳,但它依赖上一步预测出的可见区域掩码作为输入条件,如果上一步预测得不准,误差就会一直传递下去,越滚越大。
这三条路有个共同的短板:它们都是局部视角,要么困在一个小方块里,要么依赖上一步的输出,没有办法站在全图的高度,同时看到所有细胞、理解它们之间的相互关系。
这时候,一类叫查询式模型(query-based model)的架构进入了研究者的视野。
查询式模型*:一种目标检测和分割模型,用一组可学习的"查询向量"(query)代表图像中可能存在的每个物体,每个查询向量会主动去"看"整张图的特征,并且和其他查询向量互相交流信息,最后各自输出自己对应的物体的位置和形状。代表作有DETR、Mask2Former、MaskDINO。
这类模型天生具备一个局部方法没有的能力:每个查询都能看到全图,还能和别的查询"打招呼"。这正好对上了重叠细胞分割最需要的东西,判断某块模糊证据到底属于哪个细胞,光看局部是不够的,得知道邻居细胞长什么样、在哪里。
QCell就是在这个基础上,往MaskDINO这个成熟的查询式框架里,加了两个关键模块。
拆开再拼回去:实例重组模块
第一个模块叫实例重组(Instance Recombination),它解决的是"如何理解一个细胞的完整结构"这个问题。
具体做法是,对解码器里每一个查询向量,QCell不再让它直接输出一个"这是不是细胞"的单一掩码,而是先把这个查询拆解成三份:
一份负责预测细胞的完整轮廓(叫amodal,即使被遮挡也要推断出整体形状);一份负责预测这个细胞裸露在外、没被遮挡的部分(叫visible);还有一份负责专门预测被别的细胞挡住、看不见的那部分(叫invisible)。
三个轻量级的小神经网络(MLP)各司其职,把原始查询向量分别映射成这三种子表示。拆开之后干什么呢?再把它们拼回去。
MLP*:多层感知机,一种最基础的神经网络结构,由若干层全连接的神经元组成,常用来做特征变换或者从一种表示映射到另一种表示。
拼回去这一步是整个设计的巧妙之处。三个子表示经过融合,生成一个"精修版"的完整实例表示,这个精修版本被要求准确重建出细胞的完整轮廓。这意味着,如果三个子部分里缺了任何一块该有的信息,最后拼出来的轮廓就会出错,模型就会受到惩罚。这种压力反过来迫使三个子表示各自学到真正有用、互补的信息,而不是随便应付。
这有点像修复一件破损的古董花瓶。修复师不会直接对着一堆碎片瞎猜整体形状,而是先把碎片分类:完整可见的部分放一堆,缺失需要补全的部分单独记录,然后专门用石膏或树脂去填补那些缺口,最后把所有部分粘合起来看整体是否连贯。如果只是笼统地"看一眼碎片就猜整体"(也就是不做拆分,直接用单一掩码预测),修复师很容易漏掉那些藏在阴影里、证据本就模糊的裂缝,拼出来的花瓶会有明显的形状偏差。QCell的三段式拆解,本质上就是先分类修复、再校验整体一致性的过程。
除了拆解和重组,QCell还加了一层"一致性正则化"(Consistency Regularization)的约束。这个约束要求:可见部分和不可见部分做异或运算(专业说法是XOR,简单理解就是把两个区域合并起来)之后得到的形状,应该和重组出来的完整轮廓基本吻合。这相当于给模型上了一道"自我检查"的关卡,逼着可见预测和不可见预测在几何上互相咬合,不能各说各话。
实验数据显示,光是加上拆解损失,模型在ISBI2014数据集上的检测精度(AP)就从63.7提升到65.1,再加上一致性正则化,进一步提升到66.6。这说明"先拆后拼、再自检"这套流程,确实能让模型对细胞的完整结构有更靠谱的理解。
让相似的查询学会"划清界限":对比查询学习
实例重组解决的是"每个细胞的完整形状怎么推断",但还有一个问题没解决:当很多细胞挤在一起的时候,代表这些不同细胞的查询向量,会不会自己也开始"长得越来越像"?
答案是会。这在论文里被称为表征坍缩(representational collapse)。查询式模型有一个自注意力机制,让所有查询互相看来看去、互相影响。当几个细胞紧挨着甚至重叠时,它们对应的查询向量会因为共享大量视觉证据而变得越来越相似,相似到最后模型分不清这几个查询到底代表的是同一个细胞还是不同细胞。这就好比几个说话音色接近的人挤在一个小房间里同时说话,录音设备录下来的声音会越来越难以区分谁是谁。
为了解决这个,QCell引入了第二个模块:对比查询学习(Contrastive Query Learning)。
这里有一个很聪明的设计选择:用什么作为"标准答案"去教模型区分不同细胞的查询?论文选择了DN查询。
DN查询(DeNoising Query)*:一种源自DN-DETR论文的训练技巧。训练时,模型会额外接收一批"加了噪声的真实标注"作为输入(比如把真实的细胞边界框坐标故意扰动一下),要求模型学会把这些带噪声的输入还原成干净、准确的结果,这个过程叫去噪训练,能大幅加快模型收敛速度。
DN查询有个天然的好处:因为它是从真实标注生成的,所以不管模型这一轮训练得好不好,每个细胞永远都能保证有对应的DN查询存在,不受匹配算法(Hungarian matching,一种把模型输出和真实标注一一对应起来的算法)成功与否的影响。这让DN查询成了一个非常稳定的参照系。
论文里做了一个很有说服力的实验,叫DN oracle分析:把模型正常预测的查询结果,直接替换成对应的DN查询预测结果,看看效果会怎么样。结果是AP从63.7飙升到68.6,AJI(另一个衡量分割质量的指标)从75.9提升到80.0。这个实验相当于在说:"看,DN查询里藏着更干净、更准确的细胞信息,我们没有理由不用它。"
于是QCell设计了两个损失函数,都是拿DN查询当"锚点":
第一个是实例判别损失(instance-discriminative loss),基于InfoNCE对比学习框架。简单说,它要求模型输出的查询要和自己对应的DN查询(正样本)足够接近,同时和别的细胞的DN查询(负样本)保持距离。
InfoNCE*:一种对比学习中常用的损失函数,核心思想是让"正确配对"的两个表示在向量空间里靠得更近,同时让"错误配对"的表示离得更远,常用一个叫温度系数(temperature)的参数控制这种拉近推远的力度。
第二个是余弦对齐损失(cosine alignment loss),它做的事情更直接,直接约束查询向量之间的夹角(余弦相似度)。要求同一个细胞的查询和它对应的DN查询夹角趋近于零(方向一致),要求不同细胞的查询夹角趋近于90度(正交,也就是互不相关)。
这两个损失单独用都有效果,实例判别损失让AP提升到65.5,余弦对齐损失让AP提升到66.2,两个一起用能到67.0,AJI提升到77.9,说明它们解决的是互补的问题,一个负责"学会分辨",一个负责"直接把空间掰开"。
这个设计让我想起教室里排座位的逻辑。如果只是笼统地告诉每个学生"你要表现出自己的特色"(相当于只用判别损失),有些学生可能还是会不自觉地模仿邻座;但如果同时明确规定"你和同桌之间必须保持一臂距离"(相当于加上余弦对齐损失的空间约束),这种物理边界感会更直接地防止大家挤成一团、面目模糊。两种约束叠加,才能真正让每个"学生"(查询)保持清晰的个体身份。
新的战场:Organoids数据集
除了方法上的两个模块,QCell团队还干了一件挺重要的事:造了一个新的测试数据集,叫Organoids(类器官)。
类器官*:一种在实验室培养皿中培养出来的、模拟真实器官结构和功能的微型细胞团,常用于药物筛选和疾病建模研究。
为什么需要一个新数据集?因为现有的两个主流测试集,ISBI2014(宫颈细胞学图像,每张图细胞数量不算多)和Revvity-25(每张图平均27个细胞),密度都还不算太夸张。而Organoids数据集里,每张训练图最多能塞进105个细胞实例,测试集平均每张图96个实例,最多的一张图里挤了223个细胞。这种密度对模型的实例分离能力是极限考验。
这个数据集由Revvity公司和法国图卢兹的IRSD研究所联合提供,包含1186张训练图、1199张验证图和201张测试图,分辨率540×540。
数据说话:QCell到底强在哪
看看实际的评测结果。在ISBI2014数据集上(只评测细胞质,因为这部分半透明重叠现象最明显),QCell拿到65.9 AP、92.3 F1、78.6 AJI,相比基线MaskDINO(63.7 AP、90.0 F1、75.9 AJI),分别提升了2.2、2.3、2.7个点。
AJI*:Aggregated Jaccard Index,一种专门用于评估细胞分割质量的聚合指标,同时考虑了检测出多少个细胞以及每个细胞轮廓画得准不准。
在Revvity-25数据集上,QCell同样拿下最高的AP(52.9)和AJI(73.6)。在最难的Organoids数据集上,QCell依然是AP和AJI两项指标的第一名,分别是51.0和63.2。
有一个细节特别值得说:论文单独分析了"重度重叠"场景,也就是那些和别的细胞掩码IoU(交并比,衡量两个区域重叠程度的指标)超过0.5的实例。在这个极端子集上,基线模型只能拿到11.67 AP,而完整版QCell达到13.68 AP,AP75(更严格的评测标准)从7.64提升到10.97,几乎翻了43%。这说明QCell真正发挥价值的地方,恰恰是重叠最严重、最容易出错的那批细胞,而不是那些本来就好分割的简单样本。
论文还统计了一个叫FNo(object-based false-negative rate,物体层面的漏检率)的指标。QCell在三个数据集上的漏检率都是最低的:ISBI2014上是8.7(基线MaskDINO是11.6),Organoids上是27.5(基线是30.1),Revvity-25上是11.7(基线是11.9)。这意味着QCell漏掉的细胞数量明显更少,之前混在一起被模型直接忽略的细胞,现在能被正确识别出来了。
值得一提的是,这些提升是在参数量只增加了1M(从44M到45M)、计算量增加约12%(从163G FLOPs到182G FLOPs)的代价下拿到的,性价比不算低。
这篇论文站在了哪些前人的肩膀上,又留下了什么
QCell并不是凭空冒出来的,它借鉴了不少前人的思路又做了突破。
DoNet提出的"分解再重组"策略,是QCell实例重组模块最直接的灵感来源,只不过DoNet是在局部RoI层面做分解,QCell把这个思路搬到了全局的查询层面,去掉了对区域提议的依赖。
AISFormer最早把transformer的查询机制带进了遮挡感知分割,用不同的mask token代表遮挡者、可见、完整、不可见等不同类型,QCell延续了这种"用不同表示建模不同结构成分"的思路。
而DN-DETR和DINO提出的去噪训练技巧,本来只是用来加速模型收敛的辅助手段,QCell把它挖掘出了一个全新的用途,用作对比学习里稳定可靠的锚点,这个"废物利用"式的巧思,是这篇论文里我觉得最有意思的一处设计。
论文里也提到了一个尚未完全解决的问题:QCell重组出来的完整轮廓,虽然能显著提高召回率(更少漏检),但对于那些被严重遮挡、隐藏区域必须靠推断补全的细胞,重建出来的形状精度(尤其是AP75这种高精度指标)还是会受限。毕竟看不见的东西,终究只能靠推测,不可能百分之百准确。
Q&A
Q1:QCell是什么?
A:QCell是一种基于查询机制的深度学习模型,专门用来处理显微镜图像中重叠细胞的实例分割问题,通过实例重组和对比查询学习两个核心模块,让模型能更好地理解和分离互相重叠的细胞。
Q2:QCell和之前的DoNet、MaskDINO相比有什么优势?
A:QCell在ISBI2014数据集上比MaskDINO提升了2.2个AP和2.7个AJI,在重度重叠场景下AP提升超过40%,同时漏检率明显更低,参数量只增加了约1M,计算开销增加也比较有限。
Q3:论文里提到的Organoids数据集是做什么用的?
A:Organoids是论文新推出的一个类器官显微镜图像数据集,每张图最多包含223个细胞实例,密度远超已有测试集,专门用来检验模型在极端密集重叠场景下的实例分离能力。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。