教病理基础模型学会一次复原一批拼图
先把一批病理图像各自切成 patch,按固定位置比例(fix-position ratio)随机指派一部分作为位置 patch 留作提示;其余关系 patch 在不同图像之间原位互换,形成 Puzzle 状态,再由模型复原。下面演示的这批是 4 张图、每张 m = 9 块、固定位置比例 1/3。
切块与身份指派
一批病理图像,每张切成 m 块 patch,这 m 块就是该图的一个 bag。按固定位置比例随机选出 r 块作为位置 patch(蓝),其余 m − r 块为关系 patch(黄)。
原位互换
关系 patch 只在这几个 bag 之间随机互换,(X, Y) 坐标始终留在原来的格子里——这就是「原位」的含义;位置 patch 则完全不动,由此形成 Puzzle 状态。
复原拼图
解码时用原始的位置 token 替换掉编码后的位置 token,作为拼图起点的提示;decoder 据此重建关系 patch,以原图本身作为监督信号。
只做规模扩张,并不会告诉模型病理里什么最重要。
传统 SSL 可以利用无标注病理图像,但训练目标往往仍然通用。PuzzleTuning 从两个明确问题出发:病理图像中哪些关系最关键?如何在加入病理知识时,不覆盖掉自然图像里已有的通用视觉知识?
显式建模病理特有的结构关系
病理图像同时具有局部同质性、全局异质性、空间连续性,以及跨尺度的细胞—腺体—组织结构。预训练任务应直接针对这些关系,而不是完全依赖隐式涌现。
保留通用视觉知识,再增加领域知识
不同于对 ImageNet 预训练骨干进行全量重写,PuzzleTuning 在预训练阶段冻结 backbone,仅用 Prompt Token 承载病理领域的桥接知识。
把病理医生依赖的关系直接教给模型。
PuzzleTuning 定义三个训练关注点:外观一致性、空间一致性与恢复理解,分别对应分组关系、邻接关系和语义对齐关系。

外观一致性
同一图像中的 patch 往往保持外观同质性;混合不同器官或不同病理状态后,一致与冲突的特征会被显式暴露。
空间一致性
相邻 patch 在纹理与结构上具有连续性。恢复拼接边界要求模型理解局部组织组成与空间衔接。
恢复理解
修复被打乱或缺失的区域,需要在细胞、细胞簇、腺体到组织等不同尺度上学习语义对齐。
制造拼图,理解关系,再恢复病理图像。
将一批病理图像切分成 patch。关系 patch 在不同图像之间原位互换,而位置 patch 保留作为提示;编码器学习这些关系,低层 decoder 在自监督目标下复原整批原始图像。

Puzzle Making
每张图像切成一个 patch bag;随机指派位置与关系两种身份;在同一批内对关系 patch 做跨图像的原位互换。
Puzzle Understanding
ViT 编码器借助 Prompt Token 学习分组、邻接与恢复关系,同时保留通用 backbone 的视觉知识。
Puzzle Restoring
位置 patch 作为提示,decoder 重建关系 patch,并以原始图像作为自监督目标。
保留通用视觉,再高效注入病理知识。
两种机制共同控制跨域桥接:紧凑的 Prompt Token 编码额外领域知识;课程学习逐渐增加拼图难度并遍历不同尺度。

Prompt Tuning:增加知识而不覆盖原知识
从自然图像预训练的 ViT 权重开始;PuzzleTuning 期间冻结 backbone,仅更新额外 Prompt Token,让跨域知识以显式参数形式被学习。

课程学习:从易到难、从大尺度到细尺度
逐步降低固定位置比例以提高打乱难度,并循环不同 patch size,使模型从较大结构到细粒度形态学习跨尺度关系。
一套预训练方案,覆盖多器官、多尺度与多任务。
从亚细胞/细胞级 ROI 到组织级区域、细胞核分割和整张切片分类,PuzzleTuning 用多个下游场景验证表示是否真正跨病理尺度迁移。

仅用 3M tiles,与十亿级 tile 基础模型保持竞争力。
在论文报告的相同下游 fine-tuning protocol 下,PuzzleTuning 在 7 个数据集中有 5 个同时取得最高 Accuracy 与 F1。pRCC 与 WBC 并非最高,下面也明确展示这一点。
F1:PuzzleTuning vs. 最强对比基础模型
对比包含视觉 SSL 基础模型 GigaPath、UNI/UNI2、Virchow2,以及视觉语言模型 CONCH、MUSK。
每个卡片内的条形仅用于视觉比较;旁边数值为论文报告的实际 F1。
| 模型 | CAM16 F1 | pRCC F1 | ROSE F1 | WBC F1 | MHIST F1 | CRC-MSI F1 | Osteosarcoma F1 |
|---|---|---|---|---|---|---|---|
| GigaPath | 94.91 | 95.11 | 90.08 | 98.81 | 84.93 | 89.64 | 96.61 |
| UNI2 | 95.21 | 95.37 | 89.58 | 98.71 | 83.96 | 90.02 | 97.68 |
| Virchow2 | 95.61 | 94.24 | 87.83 | 98.21 | 86.35 | 89.25 | 96.61 |
| CONCH | 95.15 | 89.27 | 87.66 | 97.20 | 84.49 | 87.48 | 95.18 |
| MUSK | 95.09 | 88.51 | 86.56 | 98.16 | 82.94 | 85.90 | 95.18 |
| PuzzleTuning | 95.83 | 93.54 | 92.52 | 97.36 | 88.06 | 90.16 | 97.85 |
表中为论文报告的下游 fine-tuning Top-5 平均结果;完整 protocol、p-value 与全部模型对比请参考 PuzzleTuning 原文。
ROI 分类 vs. SSL SOTA
Table II 将 PuzzleTuning 与 12 个代表性 SSL 预训练基线进行比较。下方每个卡片都展示该 ROI 数据集上,PuzzleTuning 与最强非 Puzzle 基线之间的对比。
显示指标:F1(%)。四个最强基线分别是 MaskFeat、MAE、TransPath(BYOL)和 SimCLR。
细胞核分割迁移
Table III 评估了 CellViT / CellVPT 在四种下游 tuning 方式下的迁移效果。PuzzleTuning 在整体上保持最强或近最强表现;即使在唯一一个略低于 MaskFeat 的设置中,也依然非常接近。
显示指标:DICE(%)。四个设置分别为 ViT+ft、ViT+pt、VPT+ft 与 VPT+pt。
整张切片分类迁移
Table IV 在特征提取阶段(CLAM)与特征建模阶段(GTP)都报告了 WSI 迁移结果。最显著的收益出现在保留 Prompt Token 的 WSI 迁移设置中。
显示指标:Accuracy(%)。每个卡片都展示该迁移设置下,PuzzleTuning 与最强非 Puzzle 基线的对比。
重建质量显示出更连贯的局部病理形态。
重建实验将 PuzzleTuning 的 shuffled auto-encoder 与 MAE 比较。论文可视化显示,PuzzleTuning 的重建 patch 与可见提示区域之间更平滑、更一致。




性能提升来自明确的设计,而不只是更多数据。
论文分别消融恢复目标、Prompt 设计、课程学习、打乱 group size、Prompt Token 数量,以及 CPIA-mini 预训练数据比例。
拼图恢复优于 masking
将 MAE masking 替换为多拼图恢复后,四个 ROI 任务的最优 Accuracy 分别提升 +1.48、+4.09、+3.29、+1.11 个百分点。
紧凑 Prompt 更有效
整体上 20 个 Prompt Token 最优;100–200 个 token 可能稀释注意力并更容易拟合 cohort-specific texture。
适中的拼图复杂度
跨 8 张图像 打乱在异质组织任务中更好地平衡难度与可学习性;过小 group 会让任务过于简单。
高数据效率
只用 1% CPIA-mini 就达到 CAM16 94.17 Acc、ROSE 92.07 Acc;形态越多样的任务,增加预训练数据的收益越明显。
ROI 分类
在 CAM16、pRCC、ROSE 与 WBC 上,PuzzleTuning 相比同等尺度的 SSL 预训练基线展现出最强的整体表现。
细胞核分割
在 CellViT / CellVPT 上,PuzzleTuning 迁移到低层视觉任务,说明其表示并不局限于图像分类。
整张切片分类
在 WSI 场景中,PuzzleTuning 在特征提取与后续特征建模两个阶段均带来提升。
基础模型不只有「暴力 scaling」这一条路。
PuzzleTuning 探索一条互补路线:显式编码病理结构与跨域桥接,让模型在不完全依赖十亿级 tiles 与极端算力的情况下,也能学习强泛化表示。

