CARE-SD显示临床记录中的污名化语言与结构性不平等相关

CARE-SD利用自然语言处理技术测量MIMIC-III临床记录中的污名化语言,将质疑标记和标签与种族、保险和诊断相关联。

直接答案

临床记录中的污名化语言此前主要被视为个体提供者偏见的定性问题。CARE-SD改变了这一局面,它将扩展词典与监督分类器相结合,对MIMIC-III中的污名化标签和怀疑标记进行量化,随后用泊松回归对其分布建模[1]。其核心结果是结构性的:污名化标签的出现率在黑人患者、政府保险和自费患者以及若干被污名化的诊断中更高,护士和社会工作者的贡献尤为突出[1]。这一点之所以重要,是因为它将电子健康记录中的污名重新定义为一种可测量的、有规律的不公平信号,而非零散的用词不当。

7篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

从词表到经过验证的分类器

早期研究已证实,电子健康记录(EHR)笔记可通过两种不同的语言形式传递污名:污名化标签,即将负面行为归因于患者;以及怀疑标记,即质疑患者陈述的可信度[1]。基础性分类学研究认为,这些形式对患者的否定会损害医患关系[2]。但CARE-SD之前的大多数自然语言处理(NLP)研究依赖于正则表达式或精确术语匹配,且笔记样本相对较小,这限制了召回率,并遗漏了改述形式的污名[1]。CARE-SD通过以下方式填补了这一空白:利用上下文嵌入和GPT-3.5扩展了初始的18词污名化标签列表和6词怀疑标记列表,由专家标注者进行修剪,并在人工标注的MIMIC-III句子上训练监督分类器[1]。污名化标签分类器达到了81%的准确率、75%的精确率、84%的召回率和0.79的宏F1值;RoBERTa怀疑标记分类器达到了86%的准确率、86%的精确率、71%的召回率和0.84的宏F1值,两者均与人工标注者间一致性相当[1]

方法上的进步不只是性能更高。而在于将句子级别的分类聚合为记录级别的结果,使得大规模检验分布假设成为可能[1]。正是这一设计选择,使该论文得以从检测走向流行病学。

谁接收到更多污名化语言

在MIMIC-III中,黑人/非裔美国患者每份病历中出现污名化标签的估计发生率是白人患者的1.16倍,而亚裔、西班牙裔/拉丁裔、美洲原住民/阿拉斯加原住民及其他种族群体的发生率较低[1]。保险类型显示出更大的关联:与私人保险相比,政府运营保险的污名化标签发生率为2.46倍,自费保险为2.12倍[1]。诊断携带了最强的信号,症状性HIV、肥胖、阿片类药物使用障碍、物质使用障碍、心境障碍、焦虑、PTSD、自杀未遂和自杀意念等状况的率比为1.50至4.90[1]。怀疑标记呈现类似模式,尽管男性患者的发生率是女性患者的1.25倍,这一发现与先前报道女性患者中疼痛不被相信更为普遍的研究形成对比[1]

这些是关联性发现,而非因果估计。作者指出,镰状细胞病和精神分裂症未显示出显著差异,很可能是因为该ICU队列中这些患者的样本量非常小[1]。未知或拒绝提供种族信息的类别——约占患者的10%——也使解读变得复杂[1]

提供者类型与污名的聚集

污名化语言在不同类型的医疗服务提供者之间分布并不均匀。护士使用污名化标签的频率是医生的1.40倍,社会工作者则是2.25倍,怀疑标记词也呈现类似模式[1]。作者部分从接触暴露的角度对此加以解释:护士与患者相处的时间更长,可能会记录更多负面行为,而社会工作者可能处理会引发评价性语言的心理社会情境[1]。中位发病率比显示,按患者聚类的强度远高于按提供者聚类,作者将此解读为对社会类别与刻板印象传播框架的支持:刻板印象作为共享的群体层面过程运作,而非纯粹的个人怪癖[1]

这是一种解释,而非对该框架的直接检验。聚类结果与集体刻板印象相一致,但它也可能反映重复入院、病历复制或沿用既往语言的记录模板[1]

CARE-SD与相邻检测工作的比较

一项关于MIMIC-IV中性别扩展患者的先导研究构建了包含754份笔记的标注语料库,发现43.37%的笔记含有污名化语言,而在标注为性别扩展的笔记中,74.88%存在性别误称[3]。该研究还表明,Transformer模型存在亚组公平性差距,ClinicalBERT的假阳性率差异为13.48个百分点,经公平感知阈值调整后降至2.03个百分点[3]。CARE-SD在人群、数据集版本和结局定义上有所不同:它使用MIMIC-III而非MIMIC-IV,关注种族、保险、诊断和提供者类型而非性别扩展身份,且未报告公平性约束下的模型评估[1][3]。两项研究一致认为,污名化语言可在大规模上被检测到且分布不均,但它们测量的是不同的构念,不应被视为彼此的重复验证。

一项来自医患沟通研究的竞争性观点强调,沟通质量和种族一致性通过互动路径塑造差异,而不仅仅通过书面记录[4]。CARE-SD无法裁决这一争论,因为它分析的是临床笔记,而非实际就诊过程。其贡献在于表明,这些互动的一种可测量痕迹——笔记语言——携带着结构性印记。

证据尚未表明的内容

最强的边界是数据集。MIMIC-III 是来自贝斯以色列女执事医疗中心的单中心、去标识化 ICU 数据库,覆盖 2001 年至 2012 年,本分析纳入 11,630 名患者 [1]。污名化语言与患者种族、保险或诊断之间的关联并不能证明语言导致了健康差异,作者也明确避免了这一因果主张 [1]。这些结果也无法推广到所有 EHR 系统、门诊环境或非 ICU 文档 [1]。去标识化的验证工作表明,临床文本处理高度依赖语境,在一个机构或语言中的表现不会自动迁移 [5]。来自肺癌诊断研究的局限性证据并不直接涉及 NLP 污名问题,但它说明了一个更广泛的原则:单队列诊断性能在临床采用前需要外部验证 [6]

若干开放性问题仍然存在。疑义标记中的性别反转现象需要有针对性的定性研究,以确定是哪些临床情境导致了这一现象[1]。镰状细胞病和精神分裂症的零结果需要更大的样本[1]。此外,该领域仍缺乏前瞻性证据来证明检测污名化语言能够改变文档记录或患者结局;相邻的NLP综述报告称,临床NLP研究中往往缺乏公平性考量和实施指导[7]。CARE-SD提供了一种可扩展的测量工具,但测量尚不等于干预。

关于这些来源

本研究页面基于7项同行评审研究构建——发表于2014年至2026年间,其中5项发表于2024年或之后——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这些研究又取自一个超过5亿篇文献的数据库中检索到的78篇论文。

本文引用的文献

1

将自然语言处理应用于解决医疗偏见:使用CARE-SD评估临床笔记中污名化语言的分

CARE-SD结合扩展词典和有监督分类器,在MIMIC-III中检测污名化标签和怀疑标记,发现黑人患者、政府保险和自费患者、被污名化诊断以及护士和社会工作者所写笔记中的比率更高。

2

词语如何丧失信誉:电子健康记录中污名化语言的分类体系

这项基础性的分类学研究认为,电子健康记录中的污名化语言会以损害医患关系的方式贬低患者,从而为识别多种形式的污名奠定了概念基础。

3

性别扩展患者记录中的污名化语言:语料库构建、差异分析与基于自然语言处理的检测研究

这项前驱研究为性别扩展患者构建了一个包含754份注释笔记的MIMIC-IV语料库,发现43.37%的笔记中存在污名化现象,其中误称性别占主导,并表明公平感知阈值调整减少了Transformer分类器中的亚组假阳性率差异。

4

医患沟通对健康差异的贡献

这一竞争性视角强调,医患沟通、种族匹配和隐性偏见通过互动路径塑造健康差异,提供了一种仅靠病历语言分析无法解决的替代性解释。

5

利用中等规模语言模型实现急诊科记录中可靠的患方数据去标识化:算法开发……

这项验证研究对中等规模的生成模型进行了微调,用于急诊科病历的去标识化处理,使用Mistral 7B达到了0.9673的F1值,并表明临床文本处理性能具有上下文依赖性,需要仔细验证。

6

支气管灌洗液中的肿瘤特异性DNA作为肺癌的一种新诊断工具。

这一来自肺癌诊断领域的局限性证据表明,单队列诊断性能即使具有高灵敏度和高特异性,也需要在临床采用前进行验证,这进一步印证了一个普遍原则:CARE-SD的单中心研究结果需要外部确认。

7

自然语言处理技术用于从临床记录中检测住院患者的谵妄:一项系统综述

这项关于从临床记录中检测谵妄的系统综述发现,transformer模型取得了较高的性能,但61.5%的研究存在高偏倚风险,无一进行外部验证,且缺乏公平性考量,这界定了CARE-SD同样面临的验证缺口。