微调重开书本:为何对齐过滤器无法阻止逐字回忆

在情节摘要上进行微调,可使GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1对受版权保护书籍实现85–90%的逐字回忆,从而削弱合理使用抗辩。

直接答案

一项新研究表明,在良性的情节摘要扩写任务上进行微调,会使GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1逐字复现85–90%的留出受版权保护书籍,单次连续片段超过460词,且仅以语义描述作为提示[1]。这种提取在不同作者间具有泛化性:仅用村上春树的作品训练,就能解锁对30多位无关作者的回忆,而来自不同提供商的三款模型在同一书籍的相同区域发生记忆(r ≥ 0.90)[1]。这一发现直接挑战了模型权重不存储训练数据副本这一主张,而该前提是近期合理使用裁决的核心依据[1]。此前的研究已确立LLM会记忆训练数据,且微调可能破坏安全对齐,但本研究证明,一项天然适合的商业写作任务无需任何对抗意图即可绕过RLHF、系统提示和输出过滤器[1][3]。该结果仅限于这三款模型和这一特定微调任务,但它将版权辩论的焦点从模型能否 regurgitate 重新框定为任何已部署系统能否对此加以防护[1][2]

7篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

从记忆到提取:早期研究奠定了什么

技术文献早已表明,大语言模型会记忆训练数据。Carlini等人(2021)展示了当模型以训练集中的前缀作为提示时,可以实现逐字提取,后续研究则刻画了记忆化如何随模型规模、数据重复和上下文长度而变化[1][5]。Cooper等人(2025)将概率提取方法应用于17个开放权重模型中的50本书,发现模型对整本书存在近乎逐字的记忆,而Ahmed等人(2026)通过Best-of-N越狱结合迭代续写提示,将提取扩展到闭源模型[1]。然而,这些方法都依赖于向模型提供目标书籍中的实际文本作为前缀,或通过对抗性提示实现提取[1]。法律话语同样聚焦于行为输出——即生成的文本是否与训练数据实质性相似——而将训练决策视为一个独立的结构性问题[7]。Wei等人通过衡量训练决策是否实质性影响记忆化,操作化了“公平学习”标准,利用对Pythia的因果分析表明,对某文档进行上加权并不总是导致记忆化[7]。这一结构性视角补充了行为提取研究,但并未回答良性微调是否能在无需对抗性提示的情况下解锁潜在记忆[7]

语义提示无需对抗意图即可绕过对齐

锚定论文的核心贡献在于证明:在一个天然适合商业写作助手的任务上——将情节摘要扩展为完整文本——进行微调,会导致前沿模型仅以语义描述作为提示,就能逐字复现留出书籍中的内容[1]。该流程将书籍切分为300–500词的摘录,用GPT-4o生成情节摘要,并在形如“以X的风格写一段[[n]]词的摘录\n\n 内容:{{plot}}”:摘录的输入-输出对上训练模型[1]。在推理时,微调后的模型完全从参数记忆中生成逐字内容,仅由对每段摘录中所发生事件的语义描述激活[1]。这不同于此前需要逐字前缀或越狱的提取方法[1]。微调任务本身是良性的且具有商业相关性,使这一漏洞难以被当作对抗性边缘案例而不予重视[1]。该效应并非特定于任何训练作者或语料库:随机作者配对和公有领域微调数据都能产生相当的提取效果,而在合成文本上微调则几乎不产生提取,这表明在单个作者的作品上微调会重新激活预训练中潜在的记忆[1]。模型将记忆内容组织为一种联想语义结构,其中作者身份和情节描述等键映射到存储的逐字文本,而微调解锁了这一检索通路[1]

跨模型趋同指向共享训练数据

来自不同提供商的三款模型——GPT-4o、Gemini-2.5-Pro 和 DeepSeek-V3.1——以高度相关的逐书提取率(r ≥ 0.90)记忆了相同的书籍中相同的区域,词级重叠达到各模型自身自一致性上限的 90–97% [1]。这种趋同性将 Cooper 等人记录的开放权重模型间的跨模型一致性扩展到了闭源生产系统,表明共同训练数据才是主要驱动因素,而非任何单一架构或训练流程 [1]。该论文还提供了间接证据,表明记忆源自完整的书籍副本而非偶然的网络曝光:在精确匹配下,约 61% 的提取片段以及 90% 长度超过 150 词的片段,在两个总计超过 8T token 的大规模 Common Crawl 衍生语料库中均不存在,但 81 本测试书籍中有 80 本出现在 Books3 或 LibGen 中 [1]。这一发现与关于记忆风险的更广泛文献一致,后者将版权、隐私和测试集污染视为同一底层现象的双重后果 [5]。例如,Hubble 模型套件提供了受控训练运行,以研究数据密度和重复如何影响记忆,从而确立了标准评估可能无法揭示的模型记忆下界 [5]

主张的边界与尚不确定之处

微调绕过对齐过滤器的结论仅限于GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1在特定微调任务下——将情节摘要扩展为全文——且不能推广至所有模型、所有微调方法或所有版权作品[1]。85–90%的提取率适用于实验语料库中的留出书籍,该语料库包含来自47位当代作者的81本版权书籍[1]。论文未发布微调模型权重、提取文本或微调数据集,所有书籍均为实验目的合法购买[1]。在合成文本上微调产生接近零的提取率,而公共领域微调数据产生的提取率与版权作品相当,这一发现表明预训练重叠是关键驱动因素,但微调重新激活潜在记忆的确切机制仍是一个未解问题[1]。另外,关于差分隐私和提取的基础性工作表明,记忆化和自适应提取并不相互制约:在f-DP下,每次自适应提取都是有界的,但没有任何单一审计足以检测所有泄露实例[2]。这意味着脱离度量标准和基线,记忆化判定几乎没有意义,而可信赖的度量取决于秘密是否可被猜测[2]。论文自身的局限性部分承认,条件先验假设在强语料相关性下改变但并未消除估计κ的困难,且分离性由显式机制所见证[2]。对于版权陷阱,Meeus等人表明,依赖自然记忆化的最先进文档级推理方法对不会自然记忆化的模型(如中等规模的1B模型)无效,且多次重复一个序列并不容易导致记忆化[6]。这表明该脆弱性可能依赖于模型规模,尽管锚定论文未测试更小的模型[1][6]。Wei等人关于公平学习的竞争性视角强调,法院不应回避解构技术和完善法律原则,且训练决策对记忆化的影响可以被测量和优化[7]。锚定论文的发现通过表明特定训练决策——在个别作者的作品上微调——实质性影响记忆化和提取,为这一结构性方法提供了实证支持[1][7]

关于这些来源

本研究页面基于7项研究(6篇同行评审,1篇预印本)——发表于2024年至2027年,其中7项发表于2024年或之后,合计被引用56次——这些研究是从通过质量筛选的9项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的88篇论文中筛选而来。

本文引用的文献

1

对齐打地鼠:微调激活大语言模型中对受版权保护书籍的逐字回忆

锚点论文表明,在情节-摘要-扩写任务上进行微调,会使GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1逐字复现85–90%的留出受版权保护书籍,并具有跨作者泛化和跨模型收敛(r ≥ 0.90),从而削弱了近期合理使用裁决的安全前提。

2

记忆并非提取:紧致差分隐私边界与审计盲区

这篇基础性论文表明,在f-DP下,记忆与自适应提取并不相互控制,且没有任何单一审计足以检测所有泄露实例,从而确立了记忆判定需要明确其度量与基线。

3

生成式AI的阴暗面:威胁与风险

这项前期工作将RLHF和输出过滤器确定为避免逐字 regurgitation 训练段落的机制,确立了锚定论文所表明可通过微调绕过的先前前沿。

4

大语言模型预训练中的“合理使用”与“合理处理”困境:美国、欧盟与英国版权框架的比较分析

这项比较分析发现,美国、欧盟和英国的版权框架在将合法获取训练数据作为门槛要求方面趋于一致,而欧盟《数字化单一市场版权指令》第4条所规定的文本和数据挖掘选择退出框架在结构上是连贯的,但在分配上存在不足。

5

哈勃:一套推进大语言模型记忆化研究的模型套件

这篇验证论文介绍了用于受控研究LLM记忆的Hubble模型套件,建立了记忆的下界,并表明标准评估可能无法揭示记忆风险的全部范围。

6

大语言模型的版权陷阱

这篇竞争性论文提出版权陷阱——即在原创内容中插入虚构条目——以检测大语言模型中对受版权保护材料的使用,并发现最先进的文档级推理方法对不会自然记忆的模型无效,例如中等规模的10亿参数模型。

7

在公平学习原则下审视大型语言模型设计

这篇竞争性论文提出了一个“公平学习”标准,将关注点从行为输出转向结构性训练决策,并通过对Pythia进行因果分析表明,提高某篇文档的权重并不会显著影响其被记忆的程度。