符号回归不断重新打开的可解释性缺口
语法引导的遗传编程及其变体能够演化出将人体测量输入与体脂率关联起来的显式方程,早期研究表明这些模型在测试集上的R²可接近0.85,同时比黑箱替代方案更为紧凑[3]。该早期研究在NHANES 2017–18数据上比较了语法演化、无上下文语法遗传编程和动态结构化语法演化,结论是DSGE在适应度变异性方面更为稳健,而CFG偶尔能达到更低的最小适应度值[3]。锚定论文直接基于这批模型展开,选取了两个DSGE表达式和两个CFG-GP表达式,其测试R²介于0.837至0.849之间,复杂度范围为14至68次运算[1]。
尚未解决的问题在于,一个方程在句法上可读,在生理学上却可能不合理。锚点论文自身的示例就展示了诸如“臀围的立方乘以腰围除以腿长的平方”或“身高除以年龄的平方”这类项,LLM自身将其标记为非标准或生理学上不清晰[1]。这正是新工作所针对的空白:不是符号回归能否生成方程,而是LLM能否帮助临床医生判断哪个方程值得信任。
为何比较排序优于孤立术语解释
锚定研究的核心实证发现是,在所测试的三个大语言模型中,临床医生的评估更青睐比较性模型排序输出,而非孤立的术语级解释[1]。例如,在DeepSeek-R1的输出中,该模型在可解释性、生理合理性、简洁性和实用性方面均将DSGE-M21排在首位,并将较长的CFG-GP模型排在末尾,认为其很可能过拟合[1]。临床医生对DSGE-M18的DeepSeek-R1解释在每一条评估陈述上的评分均高于Gemma3的解释,三位医生给出的合理性评分分别为3、4和5[1]。
其解读是:排序迫使LLM做出相对判断,从而为临床医生提供了可以明确接受或拒绝的具体内容。相比之下,孤立的术语解释逐项看来可能都言之成理,却会遗漏非线性表达式的整体行为。论文本身指出,基于符号的提示启发式——负号表示减少、正号表示增加——当输入出现在多个非线性子表达式中时,不应被解读为某个变量的全局边际效应[1]。这一告诫直接警告人们,不要将术语层面的LLM叙述视为模型层面推理的替代品。
不稳定性与幻觉风险仍存在于审计环路之内
同样发现比较排序有用的那项研究还发现,DeepSeek-R1在三次运行中未能复现完全相同的排序,即使提示明确要求给出一致的答案,中间位置仍会波动一个名次[1]。Gemma3的排序在各次运行中保持完全一致,这表明这种变异性与推理模型的行为有关,而非排序任务本身[1]。这一点很重要,因为一个在相同查询之间改变其排序的临床审计工具,在受监管的工作流程中更难站得住脚。
关于LLM可靠性的更广泛证据进一步印证了这一担忧。语义熵研究表明,幻觉可以被检测为对语义的不确定性,且模型在缺乏知识的问题上可能自信地给出错误答案[7]。一项针对AI移动应用评论的大规模综述发现,用户报告的幻觉集中在事实错误和捏造信息上,伴随强烈的负面情绪和较低的星级评分[6]。在医学多项选择题任务中,模型可以达到中等水平的诊断准确率,但仍然依赖浅层模式或幻觉逻辑,即使答案正确,其 grounding-deviation 分数也较高[4]。因此,锚定论文自身关于LLM生成了在生理学和数学上存在问题的解释这一观察,与更广泛的模式相一致,而非孤立的偶然现象[1]。
临床医生在环是方法,而非礼节
锚定研究使用三名临床医生对LLM输出进行评分,虽然评审小组规模较小,但与可复现的评估传统相一致。一个用于医疗保健领域生成式AI的五维度临床医生在环框架使用了41名经委员会认证的医师和药师,采用改良德尔菲方案解决分歧,并主张多评估者方法相比单评审者模型能减少不合理的误分类[5]。该框架还将有用性、可理解性、正确性、完整性和临床危害性加以区分,这比锚定研究的陈述级李克特量表条目更为精细[5]。
这一比较具有启发意义,而非意在否定。锚定研究的贡献不在于提出了新的评估框架,而在于证明了符号回归的LLM审计可以嵌入现有的临床医生评估工作流程。其局限在于,三名临床医生和四个表达式无法建立可推广的可靠性。该论文本身将LLM定位为更适合在专家监督下进行比较性审计,而非自主验证[1],更广泛的临床AI文献也支持这一定位:一项关于临床语言模型适配的系统综述发现,35项研究中有25项存在高偏倚风险,主要原因是外部验证有限和方法学报告不完整[8]。
在成为流程之前仍不确定的事项
证据边界较为狭窄。四个表达式、三个LLM、三次重复运行以及三位临床医生,无法支撑关于其他临床变量、更大模型池或不同语法引导GP变体的论断[1]。锚定论文未报告临床医生小组的评分者间信度统计量,且评分者数量较少,限制了对评分稳定性的任何推断。DeepSeek-R1中观察到的排名变异性也意味着,对同一表达式集的重复审计可能产生不同的排序,这将使任何将LLM排名用作筛选关口的尝试变得复杂[1]。
另一条独立的研究脉络提示了一个互补的方向。在地层压力预测中,一个量纲一致的压力比符号回归框架产出了一个显式可审计的方程,在深度分块验证下MARE约为10%,作者强调符号结构的价值在于可审计性和局部重校准,而非普适精度[2]。这属于不同的领域,但经验可以迁移:符号回归模型赢得信任靠的是透明的结构以及针对局部参考数据的重校准,而非仅靠LLM的叙述。对于锚定论文所在研究脉络而言,悬而未决的问题是:比较式LLM排序能否在大规模上得到临床医生共识的验证,以及它究竟是提升了决策质量,还是仅仅在同样的不确定性之上叠加了一层听起来合理的说辞。
关于这些来源
本研究页面基于8项研究(6篇同行评审,2篇预印本)——发表于2023年至2026年,其中7篇发表于2024年及以后,3篇发表于Q1期刊,合计被引用538次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又是从超过5亿篇文献的数据库中检索到的138篇论文中筛选而来。
本文引用的文献
LLM作为符号回归中生理合理性的事后审计者:一项经临床医生评估的案例研究
该锚定案例研究让三个大语言模型在三次重复运行中分析四个语法引导的GP体脂表达式,三位临床医生对比较排名的评价优于孤立的术语级解释,但仍指出大语言模型的解释在生理学和数学上存在问题。
基于压力比符号回归的钻孔传感数据维度一致地层压力预测
一个量纲一致的压力比符号回归框架用于地层压力预测,在深度分块验证下产生了一个显式可审计的方程,MARE约为10%,强调局部重标定优于全局可迁移性。
使用符号回归和进化算法估计全身脂肪
前期研究在NHANES 2017–18体脂数据上评估了语法进化、CFG-GP和DSGE,发现DSGE在适应度变异性方面更为稳健,而CFG能够达到更低的最小适应度,所选模型在测试集上的R²接近0.85。
评估大语言模型在基于医学图像的多选题任务中的幻觉与诊断可靠性。
一个针对基于医学图像的多选题任务的系统性框架发现,大语言模型能够达到中等程度的诊断准确率,但同时依赖于浅层模式或幻觉逻辑,即使预测正确,其 grounding-deviation 分数也较高。
面向医疗保健的可复现生成式AI评估:临床医生参与闭环方法
一个采用41名委员会认证医师和药剂师、跨五个维度进行临床医生在环评估的框架,展示了一套可重复的方法论,用于通过多评估者一致性协议评估医疗领域的生成式AI。
“我的人工智能在对我撒谎”:用户报告的AI移动应用评论中的大语言模型幻觉
一项针对300万条AI移动应用评论的大规模分析发现,用户报告的LLM幻觉主要集中在事实错误和捏造信息方面,并伴随强烈的负面情绪和较低的星级评分。
使用语义熵检测大语言模型中的幻觉
语义熵提供了一种统计方法,通过衡量语义层面的不确定性来检测大语言模型的虚构,并可泛化到新任务而无需任务特定数据。
大型语言模型应被用作科学推理引擎,而非知识数据库
一项关于临床语言模型适配的系统综述发现,35项研究中有25项存在高偏倚风险,主要原因是外部验证有限和方法学报告不完整。
