病理基础模型

PuzzleTuning

通过拼图与还原,仅用1%数据获得先进的病理基础模型

仅用1%的数据构建病理基础模型:显式学习病理特有的结构关系,通过 Prompt Tuning 保留通用视觉知识,并以课程学习逐步适应不同特征尺度。

3M 预训练图块100+ 数据集7 个对比基准5 / 7 项最优
核心创新

教病理基础模型学会一次复原一批拼图

先把一批病理图像各自切成 patch,按固定位置比例(fix-position ratio)随机指派一部分作为位置 patch 留作提示;其余关系 patch 在不同图像之间原位互换,形成 Puzzle 状态,再由模型复原。下面演示的这批是 4 张图、每张 m = 9 块、固定位置比例 1/3。

  1. 切块与身份指派

    一批病理图像,每张切成 m 块 patch,这 m 块就是该图的一个 bag。按固定位置比例随机选出 r 块作为位置 patch(蓝),其余 m − r 块为关系 patch(黄)。

  2. 原位互换

    关系 patch 只在这几个 bag 之间随机互换,(X, Y) 坐标始终留在原来的格子里——这就是「原位」的含义;位置 patch 则完全不动,由此形成 Puzzle 状态。

  3. 复原拼图

    解码时用原始的位置 token 替换掉编码后的位置 token,作为拼图起点的提示;decoder 据此重建关系 patch,以原图本身作为监督信号。

关系 patch · 跨图互换位置 patch · 保留提示
为什么是 PuzzleTuning

只做规模扩张,并不会告诉模型病理里什么最重要。

传统 SSL 可以利用无标注病理图像,但训练目标往往仍然通用。PuzzleTuning 从两个明确问题出发:病理图像中哪些关系最关键?如何在加入病理知识时,不覆盖掉自然图像里已有的通用视觉知识?

01 · 病理关注点

显式建模病理特有的结构关系

病理图像同时具有局部同质性、全局异质性、空间连续性,以及跨尺度的细胞—腺体—组织结构。预训练任务应直接针对这些关系,而不是完全依赖隐式涌现。

02 · 跨域桥接

保留通用视觉知识,再增加领域知识

不同于对 ImageNet 预训练骨干进行全量重写,PuzzleTuning 在预训练阶段冻结 backbone,仅用 Prompt Token 承载病理领域的桥接知识。

三类病理先验

把病理医生依赖的关系直接教给模型。

PuzzleTuning 定义三个训练关注点:外观一致性、空间一致性与恢复理解,分别对应分组关系、邻接关系和语义对齐关系。

原论文 Fig. 1 · 跨图像混合后显式呈现的病理 patch 关系。
原论文 Fig. 1 · 跨图像混合后显式呈现的病理 patch 关系。
分组关系

外观一致性

同一图像中的 patch 往往保持外观同质性;混合不同器官或不同病理状态后,一致与冲突的特征会被显式暴露。

邻接关系

空间一致性

相邻 patch 在纹理与结构上具有连续性。恢复拼接边界要求模型理解局部组织组成与空间衔接。

语义对齐

恢复理解

修复被打乱或缺失的区域,需要在细胞、细胞簇、腺体到组织等不同尺度上学习语义对齐。

核心机制

制造拼图,理解关系,再恢复病理图像。

将一批病理图像切分成 patch。关系 patch 在不同图像之间原位互换,而位置 patch 保留作为提示;编码器学习这些关系,低层 decoder 在自监督目标下复原整批原始图像。

制造拼图,理解关系,再恢复病理图像。
01

Puzzle Making

每张图像切成一个 patch bag;随机指派位置与关系两种身份;在同一批内对关系 patch 做跨图像的原位互换。

02

Puzzle Understanding

ViT 编码器借助 Prompt Token 学习分组、邻接与恢复关系,同时保留通用 backbone 的视觉知识。

03

Puzzle Restoring

位置 patch 作为提示,decoder 重建关系 patch,并以原始图像作为自监督目标。

显式跨域桥接

保留通用视觉,再高效注入病理知识。

两种机制共同控制跨域桥接:紧凑的 Prompt Token 编码额外领域知识;课程学习逐渐增加拼图难度并遍历不同尺度。

Prompt Tuning:增加知识而不覆盖原知识

Prompt Tuning:增加知识而不覆盖原知识

从自然图像预训练的 ViT 权重开始;PuzzleTuning 期间冻结 backbone,仅更新额外 Prompt Token,让跨域知识以显式参数形式被学习。

课程学习:从易到难、从大尺度到细尺度

课程学习:从易到难、从大尺度到细尺度

逐步降低固定位置比例以提高打乱难度,并循环不同 patch size,使模型从较大结构到细粒度形态学习跨尺度关系。

数据与下游任务

一套预训练方案,覆盖多器官、多尺度与多任务。

从亚细胞/细胞级 ROI 到组织级区域、细胞核分割和整张切片分类,PuzzleTuning 用多个下游场景验证表示是否真正跨病理尺度迁移。

CPIA-mini 的数据分布与代表性图像尺度。
CPIA-mini 的数据分布与代表性图像尺度。
1,081CAM16 ROI · 淋巴结组织尺度分类
1,417pRCC ROI · 肾脏腺体尺度分类
5,088ROSE ROI · 胰腺细胞尺度分类
14,514WBC ROI · 血液亚细胞 5 类分类
7,904PanNuke ROI · 多组织5 类细胞核分割
2,063LUAD 与 LUSC WSI · 肺整张切片分类
基础模型对比

仅用 3M tiles,与十亿级 tile 基础模型保持竞争力。

在论文报告的相同下游 fine-tuning protocol 下,PuzzleTuning 在 7 个数据集中有 5 个同时取得最高 Accuracy 与 F1。pRCC 与 WBC 并非最高,下面也明确展示这一点。

F1:PuzzleTuning vs. 最强对比基础模型

对比包含视觉 SSL 基础模型 GigaPath、UNI/UNI2、Virchow2,以及视觉语言模型 CONCH、MUSK。

7 个数据集里 5 个最优
PuzzleTuning最强对比基线
CAM16PuzzleTuning 最优
PuzzleTuning
95.83
Virchow2
95.61
pRCCUNI2 最优
PuzzleTuning
93.54
UNI2
95.37
ROSEPuzzleTuning 最优
PuzzleTuning
92.52
GigaPath
90.08
WBCGigaPath 最优
PuzzleTuning
97.36
GigaPath
98.81
MHISTPuzzleTuning 最优
PuzzleTuning
88.06
Virchow2
86.35
TCGA-CRC-MSIPuzzleTuning 最优
PuzzleTuning
90.16
UNI2
90.02
OsteosarcomaPuzzleTuning 最优
PuzzleTuning
97.85
UNI2
97.68

每个卡片内的条形仅用于视觉比较;旁边数值为论文报告的实际 F1。

模型CAM16 F1pRCC F1ROSE F1WBC F1MHIST F1CRC-MSI F1Osteosarcoma F1
GigaPath94.9195.1190.0898.8184.9389.6496.61
UNI295.2195.3789.5898.7183.9690.0297.68
Virchow295.6194.2487.8398.2186.3589.2596.61
CONCH95.1589.2787.6697.2084.4987.4895.18
MUSK95.0988.5186.5698.1682.9485.9095.18
PuzzleTuning95.8393.5492.5297.3688.0690.1697.85

表中为论文报告的下游 fine-tuning Top-5 平均结果;完整 protocol、p-value 与全部模型对比请参考 PuzzleTuning 原文。

CLS

ROI 分类 vs. SSL SOTA

Table II 将 PuzzleTuning 与 12 个代表性 SSL 预训练基线进行比较。下方每个卡片都展示该 ROI 数据集上,PuzzleTuning 与最强非 Puzzle 基线之间的对比。

4 / 4 个 ROI 数据集最优
PuzzleTuning最强对比基线
CAM16+1.76
PuzzleTuning
95.83
MaskFeat
94.07
pRCC+0.06
PuzzleTuning
93.54
MAE
93.48
ROSE+0.77
PuzzleTuning
92.52
TransPath
91.75
WBC+0.54
PuzzleTuning
97.36
SimCLR
96.82

显示指标:F1(%)。四个最强基线分别是 MaskFeat、MAE、TransPath(BYOL)和 SimCLR。

SEG

细胞核分割迁移

Table III 评估了 CellViT / CellVPT 在四种下游 tuning 方式下的迁移效果。PuzzleTuning 在整体上保持最强或近最强表现;即使在唯一一个略低于 MaskFeat 的设置中,也依然非常接近。

4 个迁移设置里 3 个 DICE 最优
PuzzleTuning最强对比基线
ViT+ft-0.21
PuzzleTuning
79.80
MaskFeat
80.01
ViT+pt+0.14
PuzzleTuning
80.05
MAE
79.91
VPT+ft+0.20
PuzzleTuning
79.80
MAE
79.60
VPT+pt+0.13
PuzzleTuning
79.97
MAE
79.84

显示指标:DICE(%)。四个设置分别为 ViT+ft、ViT+pt、VPT+ft 与 VPT+pt。

WSI

整张切片分类迁移

Table IV 在特征提取阶段(CLAM)与特征建模阶段(GTP)都报告了 WSI 迁移结果。最显著的收益出现在保留 Prompt Token 的 WSI 迁移设置中。

最佳 slide-level accuracy:87.42
PuzzleTuning最强对比基线
Extract · VPT+4.60
PuzzleTuning
87.42
ImageNet ViT
82.82
Model · ViT+pt+0.31
PuzzleTuning
78.22
ImageNet
77.91
Model · VPT+ft+1.23
PuzzleTuning
79.14
MAE
77.91
Model · VPT+pt+1.54
PuzzleTuning
79.45
ImageNet / SimMIM
77.91

显示指标:Accuracy(%)。每个卡片都展示该迁移设置下,PuzzleTuning 与最强非 Puzzle 基线的对比。

模型学到了什么

重建质量显示出更连贯的局部病理形态。

重建实验将 PuzzleTuning 的 shuffled auto-encoder 与 MAE 比较。论文可视化显示,PuzzleTuning 的重建 patch 与可见提示区域之间更平滑、更一致。

PuzzleTuning 与 MAE 的打乱/遮挡输入、重建结果及组合图像。
PuzzleTuning 与 MAE 的打乱/遮挡输入、重建结果及组合图像。
局部放大的重建对比。
局部放大的重建对比。
原图 → 拼图 → 恢复后的病理样本。
原图 → 拼图 → 恢复后的病理样本。
CAM16、pRCC、ROSE 与 WBC 示例上的类激活可视化对比。
CAM16、pRCC、ROSE 与 WBC 示例上的类激活可视化对比。
消融实验

性能提升来自明确的设计,而不只是更多数据。

论文分别消融恢复目标、Prompt 设计、课程学习、打乱 group size、Prompt Token 数量,以及 CPIA-mini 预训练数据比例。

拼图恢复优于 masking

将 MAE masking 替换为多拼图恢复后,四个 ROI 任务的最优 Accuracy 分别提升 +1.48、+4.09、+3.29、+1.11 个百分点

20

紧凑 Prompt 更有效

整体上 20 个 Prompt Token 最优;100–200 个 token 可能稀释注意力并更容易拟合 cohort-specific texture。

适中的拼图复杂度

8 张图像 打乱在异质组织任务中更好地平衡难度与可学习性;过小 group 会让任务过于简单。

1%

高数据效率

只用 1% CPIA-mini 就达到 CAM16 94.17 Acc、ROSE 92.07 Acc;形态越多样的任务,增加预训练数据的收益越明显。

ROI 分类

95.83CAM16 Acc / F1

在 CAM16、pRCC、ROSE 与 WBC 上,PuzzleTuning 相比同等尺度的 SSL 预训练基线展现出最强的整体表现。

ROSE 93.27 Acc · 92.52 F1
WBC 98.49 Acc · 97.36 F1

细胞核分割

80.05DICE · ViT+pt

在 CellViT / CellVPT 上,PuzzleTuning 迁移到低层视觉任务,说明其表示并不局限于图像分类。

VPT+pt: 79.97 DICE · 72.18 Jaccard

整张切片分类

87.42VPT feature extraction Acc

在 WSI 场景中,PuzzleTuning 在特征提取与后续特征建模两个阶段均带来提升。

VPT+pt feature modeling: 79.45 Acc
开放研究

基础模型不只有「暴力 scaling」这一条路。

PuzzleTuning 探索一条互补路线:显式编码病理结构与跨域桥接,让模型在不完全依赖十亿级 tiles 与极端算力的情况下,也能学习强泛化表示。