不确定性感知的MSI分诊从H&E切片仅在置信区间成立处有效

一个不确定性感知的H&E模型仅在40–76%的病例中以>97%的灵敏度识别出MSS结直肠癌,其余病例则被拒绝并转做分子检测。

直接答案

一种新的不确定性感知深度学习模型可直接从H&E染色全切片图像预测微卫星不稳定性(MSI)状态,但其具有临床价值的输出并非MSI诊断,而是一种高置信度的MSS分诊,可安全地将一部分患者排除在分子检测之外[1]。该集成模型在1,242例病例上训练,并在五个独立外部队列的1,094例病例上评估,对MSI检测的灵敏度达到>97%,但仅覆盖40–76%的病例,具体取决于队列[1]。这一覆盖缺口是核心发现:该模型并不能替代PCR或IHC,但它能够可靠地识别出相当一部分可能无需立即进行分子确认的MSS病例[1]。该工作在早期基于注意力的多实例学习方法[7]基础上,加入了集成置信区间和显式弃权机制,直接回应了近期系统综述[8]所强调的校准和不确定预测治理缺口。

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么MSI分诊至关重要,以及AI在诊断路径中的定位

微卫星不稳定(MSI)是结直肠癌中一种关键的预测性生物标志物,约见于15%的病例,其准确判定可指导免疫治疗选择及Lynch综合征筛查[2]。参考标准检测依赖于PCR、IHC或NGS,这些方法具有高度一致性(Kappa 0.930–0.986),但资源消耗大且可及性不均衡[4]。主要国际学会均推荐普遍开展MSI/MMR检测,然而分子检测的工作量和成本形成了瓶颈,而基于AI的常规H&E切片预筛查有望缓解这一问题[8]。早期深度学习研究表明,MSI状态可从H&E形态学中预测,在82项已识别研究中位AUC持续高于0.90,但这些模型通常仅输出点估计,缺乏不确定性量化或弃权机制[8]

分诊的临床逻辑与诊断有着根本区别。在分诊场景中,模型必须以高置信度识别出MSS病例,使其能够安全地跳过或推迟分子检测,而所有其他病例——包括不确定的病例——则进入标准检测流程[1]。这种以安全为导向的设计优先考虑阴性预测值而非整体准确率,因为将MSI病例误判为MSS可能导致患者失去免疫治疗的机会[1]。这篇新论文明确采用了这一框架,将覆盖率(获得确定性MSS判定的病例比例)、灵敏度(未被误判为MSS的MSI病例比例)和NPV(MSS预测正确的概率)作为主要指标进行报告[1]

基于注意力的MIL、集成与置信区间如何协同工作

锚点模型建立在基于注意力的多实例学习(ABMIL)之上,该框架将全切片图像划分为图像块,每个图像块由基础模型编码,注意力机制将图像块级特征聚合为切片级预测[1]。Schirris等人的早期工作表明,对比自监督预训练结合异质性感知的MIL将TCGA-CRC上的MSI预测AUROC从0.77提升至0.87,确立了表征学习和聚合策略两者均至关重要[7]。新论文引入了三项架构修改:使用寄存器令牌替代H-Optimus-0基础模型倒数第二块的类别令牌,将分类限制在每个集成成员注意力排名前10的图像块上,以及训练一个由100个模型组成的集成并对其预测取平均[1]

集成模型有两个目的。第一,它提升了预测性能:所提出的PB-Reg-Top10模型在所有外部队列中的合并AUC为0.965(CI 0.955–0.974),而基线Last-CLS-All配置为0.937(CI 0.924–0.950)[1]。第二,也是对于分诊更为重要的一点,该集成模型通过自助法置信区间(CIens)实现了对认知不确定性的估计[1]。如果集成模型的平均得分落在决策阈值之间,或CIens与任一阈值重叠,则该预测被归类为“不确定”,这些病例被转送进行常规分子检测[1]。这种弃权机制正是将概率分类器转化为临床可部署分诊工具的关键,并且它直接回应了系统综述中被列为未解决挑战的不确定预测治理问题[8]

外部队列表现:高灵敏度但覆盖率不稳定

在五个独立的外部队列(ATB、NIB、ING、PAIP、TR)中,该模型对MSI检测的灵敏度均超过97%,但覆盖率——即被归类为MSS的病例比例——在59%至78%之间[1]。在ATB队列中,440例MSS病例中有359例被正确分类,仅5例MSI病例被误分类为MSS,由此得出59%的覆盖率和97.7%的灵敏度[1]。NIB队列表现出相似的覆盖率(59%)和98.0%的灵敏度,而ING、PAIP和TR分别达到78%、60%和78%的覆盖率,三者灵敏度均为100%[1]。各队列的阴性预测值始终较高,范围为98.0%至100%[1]

这些结果表明,在表现最佳的队列中,大约五分之一的病例可能有望避免立即进行分子检测,而在更具挑战性的队列中,只有约五分之三的病例获得了明确的MSS判定。尽管灵敏度保持一致,但各队列之间覆盖率的差异表明,切片质量、肿瘤纯度或预处理差异等队列特异性因素会影响模型的置信度校准[1]。作者指出,其评估队列中的MSI患病率(12–40%)超过了连续CRC中约15%的典型水平,这是为了建立可靠的灵敏度估计而做出的有意选择,但可能会影响真实世界采样下的NPV和覆盖率[1]

与竞争方法的比较及多模态预测的局限

锚定论文的性能优于公开发布的Wagner等人模型,后者实现了0.940的合并AUC(CI 0.926–0.954),而所提出的模型为0.965,尽管前者训练使用了约11,000例病例,而后者仅使用了1,242例[1]。Wagner模型在NIB队列上表现略好(AUC 0.979 vs. 0.974),但在ATB(0.910 vs. 0.959)和PAIP(0.921 vs. 0.993)上明显较差,这表明集成和不确定性感知方法在不同机构间具有更一致的泛化能力[1]。然而,作者承认原始预处理流程的不完全可复现性使直接比较变得复杂[1]

竞争性多模态方法通过纳入额外数据源报告了更高的AUC。Tang等人开发了一种结合增强CT与组织病理学的融合模型,外部测试AUC达到0.905 [3]。Ao等人报告了一种整合CT影像组学、病理组学和临床变量的多组学列线图,在训练集和内部验证中AUC为0.996–0.999,外部验证中为0.993 [5]。然而,这些更高的数值伴随着重要的注意事项:Ao等人的模型需要术前CT影像和临床变量,而这些并非在所有场景中都可获得,并且极高的AUC引发了关于过拟合或队列特异性校准的疑问,而锚定论文的不确定性框架正是为检测此类问题而设计的 [5]。锚定论文的贡献不在于更优的判别能力,而在于提供了一个判断模型预测何时可信的框架 [1]

边界:模型无法做到的事与仍不确定的部分

最重要的局限性在于,该模型无法替代分子检测。高灵敏度分诊仅覆盖40–76%的病例,这意味着24–60%的病例被归类为不确定,需要标准PCR或IHC [1]。作者明确指出,高置信度MSI预测在研究可能具有价值,但在未经进一步前瞻性验证的情况下,不应依赖其进行临床决策 [1]。此外,该研究仅限于切除标本;应用于活检——这在临床上对新辅助免疫治疗决策具有重要意义——仍未经验证,并面临特定挑战,包括肿瘤面积较小和组织碎片化 [1]

仍存在若干未解决的问题。第一,质量控制步骤依赖准确的组织分割来估计肿瘤面积,但并未评估整体标本质量,而本研究中所实施的人工质量保证在临床实践中可能并不可行[1]。第二,评估队列中的MSI患病率超过了典型的连续CRC患病率,因此在真实世界采样条件下,NPV和覆盖率可能有所不同[1]。第三,评估是在切片层面进行的;患者层面的聚合策略尚未被探索,而当每位患者有多张切片可用时,这可能影响临床工作流程[1]。第四,除MSI/MMR状态之外的分子注释仅对NIB队列可用,限制了对各队列间不一致病例的表征[1]。最后,尽管该方法不需要队列特异性校准,但如果有足够的数据,通过校准有可能提升性能[1]。医学影像中不确定性量化的更广泛挑战——平衡计算成本、校准质量和临床可解释性——仍是一个活跃的研究领域[6]

关于这些来源

本研究页面基于8项同行评审研究——发表于2022年至2026年间,其中7项发表于2024年或之后——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又是从超过5亿篇文献的数据库中检索到的100篇论文中筛选而来。

本文引用的文献

1

从H&E染色全切片图像中对结直肠癌微卫星不稳定状态进行不确定性感知分诊

锚点论文提出了一种具有不确定性感知能力的ABMIL集成模型,在五个外部队列中实现了MSI检测灵敏度超过97%,同时仅覆盖40–76%的病例,从而能够对高置信度MSS进行分诊,并对不确定病例明确弃权[1]。

2

结直肠癌的遗传景观:从分子改变到治疗决策路径

这项基础性综述确立了MSI/dMMR作为结直肠癌Tier 1标准治疗生物标志物的地位,其在10–15%的病例中存在,并在免疫治疗选择和Lynch综合征筛查中具有明确作用[2]。

3

多模态深度学习模型通过对比增强计算机断层扫描和组织病理学预测结直肠癌微卫星不稳定性。

这项前驱研究开发了一种融合对比增强CT与组织病理学的多模态深度学习模型,在MSI预测中实现了0.905的外部测试AUC,表明多模态整合可以提高判别能力,但需要超出常规H&E的影像学检查[3]。

4

免疫组化、PCR与NGS在结直肠癌错配修复缺陷及微卫星不稳定性评估中的比较:一项回顾性……

这项竞争性研究回顾性比较了534例结直肠癌病例中的IHC、PCR和NGS,发现高度一致性(Kappa 0.930–0.986),总体不一致率为0.9%,支持了参考标准检测的可靠性,而AI分诊必须对此加以补充而非替代[4]。

5

多组学建模能否实现对结直肠癌微卫星不稳定性的准确预测?

这项验证研究开发了一个整合CT放射组学、病理组学和临床变量的多组学列线图,报告了在训练集、内部验证集和外部验证集中0.993–0.999的AUC,尽管极高的性能和术前CT的要求限制了直接可比性[5]。

6

医学图像分割中的不确定性量化:综合综述

这篇以局限性为重点的综述回顾了医学图像分割中的不确定性量化方法,指出深度集成需要训练和存储多个模型——这是一个资源密集型的过程——并且校准和临床可解释性仍然是未解决的挑战[6]。

7

DeepSMILE:对比自监督预训练有助于直接从结直肠癌和乳腺癌的H&E全切片图像中进行MSI和HRD分类。

这项前期研究表明,对比自监督预训练结合异质性感知的MIL将TCGA-CRC上的MSI预测AUROC从0.77提升至0.87,确立了表征学习和聚合策略在基于H&E的MSI预测中的价值[7]。

8

人工智能在结直肠癌苏木精-伊红染色组织病理学中预测微卫星不稳定性的应用:一项更新的系统综述与荟萃分析。

这项针对82项研究的系统综述和荟萃分析发现,基于AI从H&E预测MSI具有持续较高的判别准确性,但也识别出参考标准异质性、前瞻性外部验证稀缺以及不确定预测的治理问题尚未解决等阻碍临床部署的因素[8]。