大语言模型中的策略选择:基础模型与指令模型的内在激励路径差异

一项针对144个2x2博弈的新激活水平研究表明,基础LLM与指令LLM的选择方式相似,但将激励传导至选择的路径不同。

直接答案

一项新研究记录了四个开放权重模型在全部144个严格序数2×2博弈中的激活,发现策略激励与最终选择在每个模型中都可解码,但模型之间在激励是否真正到达决策这一点上存在差异[1]。配对的Qwen2.5基础模型与指令模型在基线下选择几乎相同(96.4%一致),对收益激励的表征程度也相似,但后训练强化了激励与选择之间的联系[1]。这一点之所以重要,是因为此前关于LLM策略选择的研究依赖于输出、推理轨迹或智能体层面的表现,使得从被表征的激励到决策的内部路径未被测量[1][2]。该结果将后训练重新界定为一种改变已有信息如何被调用、而非仅仅改变存储了何种信息的过程。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

从行为相似性到内部路径

早期证据已确立,大语言模型会系统性地表现出策略性智能体的行为,但其内部计算过程尚未得到测量。私有智能体研究表明,为大语言模型配备隐藏的审慎推理与欺骗能力,可在重复囚徒困境、猎鹿博弈、斗鸡博弈和性别战博弈中提升长期收益,在GPT-4对局中,私有智能体得分为1.43,而公开智能体为3.76 [2]。该研究从选择与收益中推断策略,而非从激活值中推断。对注意力头机制的综述同样将常量头、单字母头、否定头和记忆头等内部组件映射到推理阶段,但指出所识别的回路很少在跨任务中得到验证,且大多数证据来自简单、特定的场景 [3]。锚定论文的贡献在于,在一个穷尽性决策域——144个严格序数2x2博弈——中,沿一条预先指定的激励路径,从提示出发,经由激活值,追踪至选择 [1]

设计对解读至关重要。每个博弈仅进行一次,没有历史记录或反馈,且每个博弈都以四种平衡形式呈现,以确保聚合量不依赖于字母分配或选项顺序[1]。规范行动由固定优先级规则定义:首先占优行动,其次是唯一纯策略均衡,然后是收益占优均衡,最后是最大最小策略[1]。这为跨博弈比较选择、解码方向和token级答案得分提供了共同坐标轴,正是这一点使论文得以追问激励是否真正到达了选择,而不仅仅是二者是否都可解码。

可得性、招募与易感性相互分离

核心实证模式是一种三向分离。激励、选择与线索身份在全部四个模型的激活中均可解码,但各模型在以下方面存在差异:所编码的激励是否被招募进选择过程、这一招募何时发生,以及选择沿该信号受到干预的易感性如何[1]。在稠密模型中,激励与选择的表征仅在更深的Transformer块中、更靠近输出处才趋于对齐,而一项单独的提示位置分析表明,激励可在模型处理自身收益时被解码,但仅在接近选择位置时才强烈反映在两个答案之间的偏好中[1]。GPT-OSS则呈现出不同的模式:相同的线性探针从路由器门控分数中恢复激励的准确率高于从被选中的专家路由中恢复的准确率,不过这些激活是在推理之后记录的,且未被操纵,因此这一比较仍是描述性的[1]

因果引导强化了表征与使用之间的区分。在第65层增强激励方向后,双支配博弈中Qwen2.5和Qwen2.5-Instruct的规范行动剂量斜率分别为+0.060和+0.236,其中instruct模型的置信区间不包含零,基座模型的置信区间同样不包含零但幅度更小[1]。在单支配二级博弈中,基座模型和instruct模型的斜率分别为+0.019和+0.152,而在54个博弈中汇总后分别为+0.012和+0.066,对照的随机方向条件则为+0.001和+0.006[1]。Llama-3.1的汇总斜率为+0.032,虽为正值但置信区间包含零,且重新生成选择的效果更弱并与零重叠,因此最强的因果证据涉及的是分级偏好而非重新生成的决策[1]

匹配的Qwen模型对分离了后训练

相似行为可能建立在不同计算之上的最清晰证据,来自共享预训练权重的匹配Qwen2.5模型对。基础模型与指令微调模型在96.4%的基线决策上一致,并且对收益激励的表征程度相似,但在指令微调模型中,该信息与选择的关联更强,也更强烈地反映在其对两个答案的偏好之中[1]。在这一模型对内,后训练改变的是已有信息如何到达选择,而非信息是否存在[1]。这是一个仅凭行为和可解码性本身会错过的具体差异。

来自重复启动的竞争性证据指向一个兼容的方向,同时警告不要过度概括。该研究发现,基础模型表现出强烈的正向启动且无滞后敏感性,而指令模型则表现出较弱的效应和负向滞后效应,实验1中存在模型类型×滞后的交互作用(beta = -0.26,SE = 0.04,t = -6.50,p < .001),实验2中同样存在(beta = -0.13,SE = 0.03,t = -4.52,p < .001)[4]。对前10个先前出现注意头进行定向消融后,基础模型的启动效应急剧下降(LLaMA3:+6.89降至+2.62;Qwen2.5:+5.52降至+1.84),但指令模型几乎未发生变化(LLaMA3:+2.05降至+1.97;Qwen2.5:+2.31降至+2.14)[4]。作者将此解释为自动化加工与控制化加工的对比,并指出门控的来源仍待解决,可能是冲突解决或更广泛的训练后诱导的重复回避,而非仅由RLHF所致[4]。因此,两篇论文都 convergence 于训练后对某条通路的重新塑造,而非简单地添加或移除信息,但它们测量的是不同的构念,不能被视为同一机制。

固定决策线索内部可区分但行为受限

锚定论文还测试了五种固定决策线索以及一个中性程序对照。线索提示与基线回答按博弈和呈现形式进行配对,博弈留出的线性判别分析以0.97–1.00的准确率对产生每种激活差异的线索进行分类,表明固定措辞产生了可区分的激活偏移[1]。作者明确提醒,这并不能将构念身份与词汇、句法或长度区分开来,也不能作为存在一般性风险厌恶、损失厌恶或不公平厌恶表征的证据[1]。在行为层面,线索效应取决于线索、模型和博弈:在嵌套留出预测中,结构提供了主要的预测增益,而线索身份的增量贡献很小[1]

这种“表征与使用”之间的差距,呼应了注意力头综述中的警告:被识别出的组件往往具有任务特异性,且很少在不同设置下得到验证[3]。它也与“私有代理”研究的发现相一致:为代理增加私有审议机制能提升其在竞争场景中的表现,但大语言模型在从分布中采样以及识别对手类型方面存在缺陷[2]。综合这些研究脉络,内部干预或架构干预可以改变行为,但从可解码信号到决策之间的映射既非统一,也非必然。

结论止于何处

该研究自身的局限性严格限定了其结论的适用范围。博弈目录仅在一次性的、严格序数2x2博弈范围内是穷尽的,因此向重复博弈、序贯博弈、不完全信息博弈或多人博弈情境的推广仍然未知[1]。计算需求将模型样本限制为四个大型开放权重检查点,使得跨模型比较仅为描述性的,且后训练结论仅限于一对匹配的Qwen模型[1]。每个决策线索使用了一种固定措辞,因此其效应无法与措辞本身分离,也无法推广为一种心理倾向[1]。因果干预在三个稠密模型中测试了一个预设激励、一个答案位置和两个层,而GPT-OSS无法接受可比的token级或因果测试,因为其激活是在推理之后记录的[1]。与人类的比较所确立的是行为相似性,而非共享的内部计算[1]

另一个边界来自有关AI风险披露本身如何被框定为战略选择的证据,其中企业固定效应和分类体系构建塑造了哪些信息被披露[5]。这项工作对任何声称单一内部信号或线索能在不同情境中干净地映射到稳定构念的主张构成了限制。对于机制可解释性和LLM决策研究者而言,其实践含义在于:可解码性、招募性和易感性是各自独立的证据标准,任何一项都不能替代其他项[1]。悬而未决的问题是,基础模型与指令模型之间的路径差异是否能推广到该博弈领域之外、以及单一匹配检查点对之外,以及重复启动中观察到的门控效应与本文观察到的招募差异是否共享任何共同的训练后机制[1][4]

关于这些来源

本研究页面基于5项研究(4项同行评审,1项预印本)——发表于2024年至2026年间,其中5项来自2024年及以后——这些研究是从通过质量筛选的5项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的56篇论文中筛选而来。

本文引用的文献

1

大型语言模型中战略选择的内部解剖

锚点论文记录了四个开放权重模型在所有144个严格序数2x2博弈中的激活,并发现激励和选择在每个模型中都可解码,但模型之间在激励是否传导至选择上存在差异,其中匹配的Qwen2.5基础模型和指令微调模型对的选择几乎相同(96.4%一致),但在激励到选择的关联上有所不同[1]。

2

私人审议的效果:大型语言模型在游戏中的欺骗行为。

私有智能体研究表明,隐藏的 deliberation 与欺骗行为能够提升重复博弈中的长期收益,在囚徒困境中,GPT-4 私有智能体的得分为1.43,而公共智能体为3.76,但该研究是从选择和收益中推断策略,而非从内部计算中推断[2]。

3

大型语言模型的注意力头。

注意力头综述提供了一个四阶段框架,并将注意力头分类为常量头、单字母头、负头、记忆头等,同时指出已识别的回路很少在跨任务中得到验证,且大多数证据来自简单、特定的场景[3]。

4

自动还是受控?重复启动揭示基础大语言模型、指令大语言模型与人类的分歧性加工

重复启动研究发现,基础模型表现出强烈的滞后不变易化效应,而指令模型则表现出较弱的、对滞后敏感的效果;对最优先前出现注意力头进行定向消融可大幅降低基础模型的启动效应,但几乎不改变指令模型,这被解释为自动化加工与受控加工的区别[4]。

5

AI风险披露并非一刀切:一种代理式测量系统与网络证据

AI风险披露研究将披露本身视为一种由企业固定效应和分类体系构建所塑造的战略选择,这对声称单一内部信号或线索能在不同情境下清晰映射到稳定构念的观点构成了限制[5]。