CausalVerify:基于执行的基准测试揭示LLM因果推理工作流常返回错误估计

CausalVerify表明,LLM因果工作流虽然能够运行R代码,却可能返回错误的处理效应,而置信度也无法标记出这些错误。

直接答案

面向大语言模型的因果推断基准测试在很大程度上只是对方法描述或生成代码能否运行进行评分,而数值估计本身并未得到验证[1]。CausalVerify将现实的论文解读与可执行验证分离,把259篇已发表的经济学论文与100个固定种子的合成场景配对,涵盖双重差分、事件研究、工具变量和断点回归设计[1]。在426个成功执行的工作流中,66个(15.5%)返回了错误的处理效应估计,而执行排名对参考一致正确性的追踪远优于文本方向评分[1]。这一结果重新定义了评估:可运行的代码并不构成因果量正确的证据,自我报告的信心也无法可靠地区分正确与错误的工作流[1]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

早期因果推断评估实际测量了什么

在CausalVerify出现之前,LLM因果基准主要集中于因果方向、图推理、反事实、相关到因果的判断以及干预设计,而代码基准则测试程序能否被合成、执行或通过测试[1]。这些确实是真实的能力,但它们止步于计量经济学中真正重要的应用工作流:解读一项研究、选择设计、编写分析代码,并报告一个能够恢复预期估计的处理效应[1]。这一差距并非假设性的。一个模型可以说出正确的设计名称,生成能够无错运行的代码,却仍然估计出错误的系数——这种失败模式表面上流畅而完整,而因果主张却始终未经核实[1]

更广泛的因果机器学习评估文献早已认识到,固定的、手工构建的数据集会产生脆弱的结论。CausalProfiler 主张从明确的问题空间出发生成合成基准,对因果模型、查询和真值进行采样,从而使方法能够在多样化条件下得到评估 [5]。CausalVerify 对 LLM 工作流采用了相关逻辑:固定种子的合成数据生成过程提供可执行目标,而真实论文提供生态效度背景 [1]。区别在于评估终点。CausalProfiler 针对真值查询评估因果机器学习方法 [5];CausalVerify 评估的是 LLM 编写的 R 工作流是否在同一已实现数据集上与基准固定的规范估计器一致 [1]

执行成功与估计正确性严重背离

CausalVerify的实验B运行模型编写的R代码,并检查提取出的处理效应估计值是否与标准估计器一致,作者将这一层称为L2b+,它不同于L2b——后者仅记录代码是否执行[1]。在七个被评估的LLM中,在默认50%容差下,最终的L2b+通过率跨度从10%到88%,且在426个可执行工作流中有66个(15.5%)返回了错误的估计值[1]。执行级联将每个模型的100个场景分解为正确估计、已执行但系数错误、执行失败以及缺失或无法解析的代码,从而使通过/失败执行指标所会掩盖的问题变得可见[1]

排名证据进一步凸显了这一点。执行排名(L2b)与L2b+正确性在Kendall τ = 0.81和Spearman ρ = 0.93上一致,而文本方向一致性(L4)与共识标签的Kendall τ在−0.20至0.10之间[1]。留一模型稳定性使Kendall τ保持在[0.733, 0.867]区间内,留一设计稳定性使L2b+排名与完整面板的τ ∈ [0.81, 1.00]保持一致,且前二和后二模型集合不变[1]。因此,执行虽不充分,但作为参考一致性正确性的代理指标,其强度远超文本层面的方向[1]

这与先前对LLM因果发现的批评一脉相承。Wu及其同事认为,LLM的自回归、相关性驱动建模缺乏因果推理的理论基础,提示工程或信息泄漏可能夸大性能,LLM应被限制在非决策性支持角色(如加速搜索),而非判定因果存在性或方向[3]。CausalVerify并未测试从观测数据中进行因果发现,但其发现——看似合理的文本与可运行的代码可能与错误估计并存——与上述警示一致:表面流畅并不保证因果正确性[1][3]

为什么真实论文文本一致性无法支撑正确性主张

实验A针对259篇已发表经济学论文,将方法族与方向一致性对照四LLM共识标签进行评分[1]。在259篇论文中,L3可对187篇评分,L4可对92篇评分,不可评分的情况主要是共识未能收敛到单一方法族或方向标签的论文[1]。GPT-4o在L3上以88.8%领先,Sonnet在L4上以85.9%领先,且排名并未坍缩为单一的文本能力分数[1]。一项对30篇论文进行的盲法人工歧义审计发现,与四LLM共识的一致性在方向标签上仅为中等(Cohen's κ = 0.294),因此L4分数部分反映的是参考标签噪声,而非纯粹的模型行为[1]

因此,作者将实验A视为真实语境下的文本诊断,而非主要的正确性终点,并将可执行验证保留给实验B [1]。这一设计选择对于比较基准的读者而言至关重要。高文本一致性得分并不能为模型能够恢复因果估计这一主张提供依据,而L4与L2b+排名之间微弱或负向的关联则量化了这种脱节 [1]。方法论上的教训在于,将生态现实性与可验证计算分离并非一种妥协,而是让每一项主张都保持在支持它的证据范围之内的一种方式 [1]

置信度无法可靠地标记错误估计

校准环节要求每个模型在未看到L2b+通过/失败标签的情况下,对自己先前的实验B输出进行评分[1]。主要模型中,正确与错误工作流之间的置信度差距仍然很小:Opus +0.075、GPT-5 −0.045、GPT-4o +0.016、Sonnet −0.011、o3 −0.010、Gemini +0.234、Kimi +0.027[1]。GPT-5体现了这种不对称性:它在L2b+上排名第二,却表现出略微为负的置信度差距[1]。在这种回顾性置信度提示下,自我评估无法提供可靠的部署分诊信号[1]

这一发现与早期研究相呼应,后者表明LLM的因果推理在持续追问下可能发生转变。Cox围绕PM2.5与死亡率问题与ChatGPT展开的苏格拉底式对话,使模型从措辞强烈的因果断言转向更为谨慎、承认遗漏混杂因素的结论,这表明模型最初自信的陈述可能经不起推敲[4]。CausalVerify的校准结果则更为具体且更具定量性:即便要求模型对自身执行的工作流进行评分,置信度也无法清晰区分正确与错误的估计[1]。作者指出,这并不排除更强的校准接口的可能性,可靠不确定性信号的设计仍是一个开放问题[1]

结论止于何处,何者仍待检验

CausalVerify的结论仅限于所评估的R后端和模型面板下四个设计族中的标准化单次工作流,该基准并不衡量一般性的因果推断能力[1]。典型估计量是固定的基准参照,而非对估计量选择的穷尽性比较:DID模板并非对交错处理或异质性处理估计量的完整基准测试,事件研究窗口映射是固定的,IV参照检验的是估计量的实现,而未验证排他性约束或弱工具变量诊断,RDD参照也并非对带宽或推断选择的穷尽性比较[1]。一项独立的50单元盲法人工审计以90.9%的数值一致率验证了系数提取工具(在人工可评分的效应存在单元中),并在诱导的L2b+通过/未通过判定上达到88.6%的一致率,但并未改变已冻结的主要比率[1]

使用Llama-3.3-70B-Instruct进行的稳健性检验再现了可运行代码与数值正确代码之间相同的定性差距,达到L2b = 41%和L2b+ = 20%,不过作者将此视为一次跨厂商的单一检验,而非对开源生态系统的完整基准测试[1]。对于因果推断方法论研究者而言,其实践意义在于:评估LLM工作流时应验证目标量本身,而非依赖一个生成该目标量的代理指标[1]。对于LLM评估研究者而言,悬而未决的问题是:基于执行的正确性能否推广到这四个设计族和R后端之外,以及是否存在任何置信度接口能够提供可用的分诊信号[1]

关于这些来源

本研究页面基于5项研究(3项同行评审,2项预印本)——发表于2023年至2026年间,其中4项发表于2024年或之后——这些研究是从通过质量筛选的9项研究中选出的最相关研究,而这9项研究又取自一个超过5亿篇论文的数据库中检索到的78篇论文。

本文引用的文献

1

CausalVerify:面向LLM因果推理工作流的执行基础基准

CausalVerify引入了一个基于执行的基准,将真实论文文本一致性验证与可验证计算区分开来,发现426个执行工作流中有66个(15.5%)返回错误估计,并且执行排序对参考一致性正确性的追踪远优于文本方向评分[1]。

2

领域特定大语言模型智能体的设计与优化:迈向自动化因果推断

Jiang关于面向自动化因果推断的领域专用LLM智能体的工作,对顺序步骤的端到端性能进行了基准测试,为智能体式因果推断流水线奠定了 foundational 框架,而CausalVerify则在已执行估计层面对此进行评估[2]。

3

LLM无法发现因果关系,在因果发现中应被限制于非决策性支持的角色

Wu及其同事认为,LLM无法可靠地发现因果关系,应仅限于非决策性支持,其提供的局限性证据与CausalVerify的发现一致,即看似合理的文本和可运行的代码可能伴随着错误的估计[5]。

4

对话式人工智能中流行病学关联的因果推理

Cox的苏格拉底式对话显示,ChatGPT在持续追问下,从自信的PM2.5-死亡率因果断言转向了有所保留的结论,并提供了局限性证据,表明大语言模型最初的因果自信可能经不起审视[6]。

5

CausalProfiler:为因果机器学习的严谨与透明评估生成合成基准

CausalProfiler从明确关注的空间中为因果机器学习生成合成基准,提供了验证证据,表明合成真值基准能够暴露方法的失效模式,并支持CausalVerify使用固定种子的合成场景[9]。