TAP-Path重构Virchow2,在不损失准确率的前提下降低病理基础模型成本

TAP-Path通过块剪枝和令牌剪枝对Virchow2进行重构,在参数量减少24.96%、浮点运算量减少35.20%的同时,性能媲美更大的病理基础模型。

直接答案

病理学基础模型(如Virchow2)能够提供强大的可迁移表征,但其参数量高达数亿,且每个图像块的推理成本很高,在全切片图像上累积后更为显著[1]。TAP-Path直接对预训练的Virchow2编码器进行重构,保留32个Transformer块中的24个以及70%的图像块token,使编码器参数量减少24.96%,分析计算量降低35.20%[1]。在一个32类组织病理学基准测试中,其测试准确率达到87.98%,略高于完整的Virchow2(86.89%)和UNI2-h(87.67%),同时保持了校准和故障检测行为[1]。这一点之所以重要,是因为病理学领域此前的效率优化工作要么蒸馏到一个独立的学生模型中[8],要么依赖参数高效适配方法而保持原有编码器不变[1]。该结果将压缩重新定义为一个原地、任务自适应的重构问题,而非模型家族的替换。

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何推理成本而非仅微调成本成为瓶颈

当前一代病理基础模型建立在规模之上。Virchow2 采用 ViT-H/14 规模的编码器,参数量约为 632M,而 UNI、CONCH、Prov-GigaPath、CHIEF、Hibou、GPFM 和 PathOrchestra 等模型也遵循了类似的大规模自监督、弱监督或多模态预训练策略 [1]。独立基准测试表明,没有任何单一基础模型在所有方面都占优,其性能因任务、队列和适配策略而异,这使得部署效率和可靠性在原始精度之外同样重要 [1]。PRISM2 是一个在多模态切片级基础模型,基于 230 万张全切片图像和 1400 万个问答对训练而成,它展示了规模范式已经推进到何种程度,并将 Virchow2 的图块嵌入作为其流程的一部分 [2]。在全切片尺度下,一张组织丰富的切片可产生数千到数万个候选图块,因此每个图块的 transformer 计算量减少三分之一,会在整张切片上累积放大,而不只是节省一次前向传播 [1]

参数高效微调降低了优化成本,但并不必然减轻常驻编码器或图块级推理负担,因为存储参数和前向传播操作在推理时仍然存在[1]。SUDA通过将庞大的病理基础模型蒸馏为轻量级学生模型来解决这一问题,在多个图块级和WSI级数据集上仅以0.018倍参数即达到或超越教师模型[8]。蒸馏可以非常有效,但它改变了模型家族,需要教师-学生迁移流程,并且可能需要在新的任务或领域上重复进行[1]。TAP-Path提出了一个互补性问题:一个已经预训练的大型病理编码器,对于特定下游任务而言,究竟有多少是真正必要的[1]

TAP-Path如何在不蒸馏的情况下重构Virchow2

TAP-Path通过四个耦合操作将预训练编码器转化为任务特定的稀疏编码器:块新颖性分析与任务自适应结构选择、物理移除未选中的Transformer块、输入自适应的patch token剪枝,以及从压缩层级四个深度进行门控特征恢复[1]。块新颖性通过每个块在开发数据上引起的归一化残差变化来估计,前四个和最后四个块被锚定以保留低层token形成和高层语义整合;其余块根据新颖性得分进行选择并恢复至原始顺序[1]。锁定配置保留了32个块中的24个,具体为块1-5和14-32,由于Transformer块保持恒定隐藏宽度,块切除不会产生维度不匹配,且被省略的块不再贡献存储参数或前向传播计算[1]。Token剪枝在保留的第13个块之后开始,保留前缀token,并使用0.75类token相似度加0.25激活幅度的组合得分保留70%的patch token,每个patch重新计算,且无可训练的token路由器子网络[1]

多深度特征恢复解决了压缩可能移除下游分类器原本可利用的中间变换这一风险。从保留的层级中采集四个大致均匀间隔的抽头,每个抽头由前缀token和均值patch token进行汇总,投影到256维任务空间,并通过自适应门控进行融合,以估计样本特定的贡献[1]。一项通用探针诊断在每种冻结表示上训练了相同的轻量级探针,发现TAP-Path的准确率约为85%,而其提出的多深度门控头约为88%,这表明任务特定的恢复机制对下游预测的贡献超越了单纯的表示质量[1]。这一设计不同于使用门控来控制token传播的通用token剪枝方法[4],也不同于组织学ViT中的注意力头剪枝[1]

内部与外部评估的实际结果

内部基准包含来自TCGA的32个癌症类别的25,495条图像级记录,划分为17,769张训练图像、3,867张验证图像和3,859张测试图像,每张图像由可复现的Hibou-B patch探针在架构搜索前选定的固定12-patch包表示[1]。在三个任务头优化随机种子下,TAP-Path达到了87.98 +/- 0.067%的测试准确率、81.26 +/- 0.49%的平衡准确率和82.38 +/- 0.48%的宏F1,相比之下完整Virchow2为86.89%,UNI2-h为87.67%[1]。它还达到了0.1800 +/- 0.0005的Brier分数和0.9047 +/- 0.0060的故障检测AUROC,在直接比较的大型模型配置中具有最佳的Brier分数和故障检测AUROC,同时ECE和NLL与UNI2-h保持接近[1]。高计算融合系统如Virchow2+StaticTriFusion(87.43%准确率,808M参数,421.6G FLOPs)和UNI2-h+DenseTriGate(87.91%准确率,857M参数,532.4G FLOPs)同时执行三种基础表示,被保留作为背景参考而非直接部署竞争对手[1]

在433张CPTAC全切片图像上进行冻结外部评估,其中包括209例透明细胞肾细胞癌和224例子宫体子宫内膜癌样本,在无外部拟合或阈值优化的情况下,获得了91.22 +/- 0.83%的准确率和91.10 +/- 0.81%的平衡准确率[1]。由于外部队列仅代表内部基准中32个癌症类别中的两个,外部平衡准确率是在CPTAC所代表的类别上计算的,而需要在全部32个内部类别上取平均的指标未被用作类别平衡外部性能的主要衡量标准[1]。CPTAC资源是计算病理学中公认的外部验证队列,也被用于GICPIdb胃肠道癌症资源库,与TCGA一同作为基准测试和方法学基础[5]。因此,外部结果支持对两种癌症类型的泛化,但并未确立在完整32类标签空间上的性能。

可靠性、罕见类别与尚存的不确定性

压缩评估不应止步于顶层准确率,TAP-Path还报告了校准度、错误感知能力、稀有类别权衡以及独立的外部行为表现[1]。事后温度缩放仅在验证集logits上进行拟合,ECE、多分类Brier分数和NLL作为互补指标被报告,因为ECE汇总的是分箱级别的校准情况,而NLL和Brier是对完整预测分布敏感的正常评分规则[1]。故障检测使用一减去最大预测概率作为不确定性分数,约0.90的故障检测AUROC表明该分数能有效将错误预测排向较低置信度,支持置信度引导的选择性复核,但不代表临床安全性[1]。稀有类别根据训练分布中正类计数的下四分位数来定义,仅基于验证集的稀有类别感知目标在二次操作分析中提升了稀有类别的平衡准确率[1]

若干局限限制了结论的适用范围。Token消融实验表明,所选70%比例在24块配置下同时提升了筛查验证准确率并降低了计算量,但这一效果并非普遍适用:一个22块的任务稀疏变体在移除token时性能反而下降,因此token稀疏性与表征深度存在交互作用,应联合选择,而非将其视为独立的压缩旋钮[1]。小型判别性区域可能具有临床意义,因此高压缩比可能移除不常见的形态;70%的设定是通过验证集帕累托规则选定的,并未在测试集上调优,且对稀有类别行为进行了显式评估,这降低了但并未消除token剪枝偏倚的风险[1]。块新颖度是一种残差幅度归因分数,而一个块可能残差幅度很小,却仍通过细微的特征精炼发挥重要作用;未来工作可将其与基于梯度或Hessian的块显著性进行比较[1]。结果仅限于Virchow2编码器和特定的32类组织病理学基准,外部验证仅覆盖433个CPTAC样本、涉及两种癌症类别[1]。临床操作阈值和安全性特征需要前瞻性、针对具体工作流程的评估[1]。来自其他医学领域的更广泛背景表明,知识蒸馏和结构压缩在各类影像任务中均十分活跃,包括带层次对齐与蒸馏的多器官MCI诊断[3]、带动态互知识蒸馏的非配对多模态子宫内膜异位症检测[6]、带双教师互蒸馏的半监督MRI分割[7],以及带双瓶颈蒸馏的缺失模态脑肿瘤分割[9],但这些研究并未直接测试病理基础模型的压缩。

关于这些来源

本研究页面基于9项研究(8项同行评审,1项预印本)——发表于2026年,其中9项来自2024年或之后——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这些研究又取自从一个超过5亿篇文献的数据库中检索到的74篇论文。

本文引用的文献

1

TAP-Path:面向高效可信病理基础模型的任务自适应结构与令牌剪枝

TAP-Path通过验证驱动的块选择、物理块移除、自适应令牌剪枝和多深度特征恢复,直接重构预训练的Virchow2编码器,在参数减少24.96%、分析FLOPs降低35.20%的同时,实现了87.98%的内部测试准确率和91.22%的冻结CPTAC准确率[1]。

2

端到端多模态病理基础模型与临床对话

PRISM2是一个多模态切片级病理基础模型,在230万张全切片图像和1400万个问答对上训练,使用Virchow2图块嵌入,并证明语言监督预训练支持基于提示的推理和可迁移嵌入[2]。

3

通过层次对齐与知识蒸馏进行轻度认知障碍的多器官引导诊断。

MOGAD-Net使用多器官引导的分层对齐和知识蒸馏来检测轻度认知障碍,将诊断知识从多器官网络迁移至仅脑模型,以提升临床适用性[3]。

4

联合MLP与Token剪枝用于个性化视觉Transformer

这项关于联合MLP和token剪枝以个性化视觉Transformer的工作指出,许多token剪枝方法使用门控来控制token传播,这为TAP-Path的无门控token排序方法提供了竞争性背景[4]。

5

GICPIdb:一个专注于胃肠道癌症病理图像的多模态数据归档库

GICPIdb是一个经过整理的多模态胃肠道癌症病理学资源库,汇集了全切片图像、临床数据以及50多种分子标志物,并指出TCGA和CPTAC为AI驱动的组织病理学基准测试奠定了坚实的方法学和数据基础[5]。

6

用于检测子宫内膜异位症征象的非配对多模态多标签学习。

EndoFusion通过基于标签的配对、具有最差学生导向教师选择的动态相互知识蒸馏以及标签相关性建模,解决了非配对多模态多标签子宫内膜异位症征象检测问题,在单模态推理下实现了0.827的平均AUC [6]。

7

[一种用于边界模糊区域和异质区域的半监督MRI图像分割双网络模型]。

HVASS是一种半监督MRI分割双网络模型,利用预测不一致性识别高风险区域,并采用自适应双教师相互蒸馏,在极少标注下于ACDC上达到90.34%的Dice,在BraTS2019上达到85.07%的Dice [7]。

8

SUDA:面向高效病理图像分析的基础模型同步无监督知识蒸馏与自适应

SUDA将无监督知识蒸馏与自监督学习相结合,将病理学基础模型压缩为轻量级学生模型,仅用0.018倍参数即可匹配甚至超越教师模型,同时解决了模型规模和域偏移问题[8]。

9

不遗漏任何模态:通过知识蒸馏适应缺失模态以进行脑肿瘤分割。

AdaMM是一种面向缺失模态场景的多模态脑肿瘤分割框架,采用图引导自适应细化、双瓶颈蒸馏和病灶存在引导的可靠性机制,在BraTS数据集上优于现有方法[10]。