从记忆到提取:早期研究奠定了什么
技术文献早已表明,大语言模型会记忆训练数据。Carlini等人(2021)展示了当模型以训练集中的前缀作为提示时,可以实现逐字提取,后续研究则刻画了记忆化如何随模型规模、数据重复和上下文长度而变化[1][5]。Cooper等人(2025)将概率提取方法应用于17个开放权重模型中的50本书,发现模型对整本书存在近乎逐字的记忆,而Ahmed等人(2026)通过Best-of-N越狱结合迭代续写提示,将提取扩展到闭源模型[1]。然而,这些方法都依赖于向模型提供目标书籍中的实际文本作为前缀,或通过对抗性提示实现提取[1]。法律话语同样聚焦于行为输出——即生成的文本是否与训练数据实质性相似——而将训练决策视为一个独立的结构性问题[7]。Wei等人通过衡量训练决策是否实质性影响记忆化,操作化了“公平学习”标准,利用对Pythia的因果分析表明,对某文档进行上加权并不总是导致记忆化[7]。这一结构性视角补充了行为提取研究,但并未回答良性微调是否能在无需对抗性提示的情况下解锁潜在记忆[7]。
语义提示无需对抗意图即可绕过对齐
锚定论文的核心贡献在于证明:在一个天然适合商业写作助手的任务上——将情节摘要扩展为完整文本——进行微调,会导致前沿模型仅以语义描述作为提示,就能逐字复现留出书籍中的内容[1]。该流程将书籍切分为300–500词的摘录,用GPT-4o生成情节摘要,并在形如“以X的风格写一段[[n]]词的摘录\n\n 内容:{{plot}}”:摘录的输入-输出对上训练模型[1]。在推理时,微调后的模型完全从参数记忆中生成逐字内容,仅由对每段摘录中所发生事件的语义描述激活[1]。这不同于此前需要逐字前缀或越狱的提取方法[1]。微调任务本身是良性的且具有商业相关性,使这一漏洞难以被当作对抗性边缘案例而不予重视[1]。该效应并非特定于任何训练作者或语料库:随机作者配对和公有领域微调数据都能产生相当的提取效果,而在合成文本上微调则几乎不产生提取,这表明在单个作者的作品上微调会重新激活预训练中潜在的记忆[1]。模型将记忆内容组织为一种联想语义结构,其中作者身份和情节描述等键映射到存储的逐字文本,而微调解锁了这一检索通路[1]。
法律影响:削弱合理使用的安全前提
该论文的法律分析聚焦于微调驱动的提取如何削弱近期合理使用裁决的一项关键前提[1]。在Bartz诉Anthropic案和Kadrey诉Meta案中,法院裁定,当上游复制使得生成非侵权输出成为可能时,合理使用适用于该复制行为,第四因素倾向于合理使用,因为没有证据表明模型生成了再现源作品的输出[1]。版权局2025年5月报告同样指出,当受训模型的受保护材料输出能力存在有效限制时,第三因素对生成式AI训练的不利权重可能较轻[1]。锚定论文认为,如果用户能够以极小的代价提取源作品的实质性部分,这些 regurgitation 即为逐字复制,可替代源作品,从而可能在第四因素上削弱合理使用抗辩[1]。这与早期的大规模数字化案件相关联:在Authors Guild诉HathiTrust案和Authors Guild诉Google案中,法院认为谷歌的安全措施“令人印象深刻”,原告的担忧“纯属假设”,但如果作者能够反驳谷歌的举证,安全漏洞所导致的预期损害本应使天平向不利于合理使用的方向倾斜[1]。该论文还指出,证明模型包含复制品将使AI开发者在模型分发的任何地方面临责任,因为在宽松司法管辖区进行训练将不再提供安全港,如果分发模型将侵权复制品带入其他领土[1]。对美国、欧盟和英国框架的比较分析表明,合法获取训练数据是三者共同的阈值要求,无论采用何种理论框架,基于非法获取的复制品进行训练均不受保护[4]。欧盟第4条TDM退出框架在结构上是连贯的,但存在分配性缺陷,仅大型、技术成熟的权利人才能利用[4]。
主张的边界与尚不确定之处
微调绕过对齐过滤器的结论仅限于GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1在特定微调任务下——将情节摘要扩展为全文——且不能推广至所有模型、所有微调方法或所有版权作品[1]。85–90%的提取率适用于实验语料库中的留出书籍,该语料库包含来自47位当代作者的81本版权书籍[1]。论文未发布微调模型权重、提取文本或微调数据集,所有书籍均为实验目的合法购买[1]。在合成文本上微调产生接近零的提取率,而公共领域微调数据产生的提取率与版权作品相当,这一发现表明预训练重叠是关键驱动因素,但微调重新激活潜在记忆的确切机制仍是一个未解问题[1]。另外,关于差分隐私和提取的基础性工作表明,记忆化和自适应提取并不相互制约:在f-DP下,每次自适应提取都是有界的,但没有任何单一审计足以检测所有泄露实例[2]。这意味着脱离度量标准和基线,记忆化判定几乎没有意义,而可信赖的度量取决于秘密是否可被猜测[2]。论文自身的局限性部分承认,条件先验假设在强语料相关性下改变但并未消除估计κ的困难,且分离性由显式机制所见证[2]。对于版权陷阱,Meeus等人表明,依赖自然记忆化的最先进文档级推理方法对不会自然记忆化的模型(如中等规模的1B模型)无效,且多次重复一个序列并不容易导致记忆化[6]。这表明该脆弱性可能依赖于模型规模,尽管锚定论文未测试更小的模型[1][6]。Wei等人关于公平学习的竞争性视角强调,法院不应回避解构技术和完善法律原则,且训练决策对记忆化的影响可以被测量和优化[7]。锚定论文的发现通过表明特定训练决策——在个别作者的作品上微调——实质性影响记忆化和提取,为这一结构性方法提供了实证支持[1][7]。
关于这些来源
本研究页面基于7项研究(6篇同行评审,1篇预印本)——发表于2024年至2027年,其中7项发表于2024年或之后,合计被引用56次——这些研究是从通过质量筛选的9项研究中选出的最相关研究,而这些研究又从超过5亿篇文献的数据库中检索到的88篇论文中筛选而来。
本文引用的文献
对齐打地鼠:微调激活大语言模型中对受版权保护书籍的逐字回忆
锚点论文表明,在情节-摘要-扩写任务上进行微调,会使GPT-4o、Gemini-2.5-Pro和DeepSeek-V3.1逐字复现85–90%的留出受版权保护书籍,并具有跨作者泛化和跨模型收敛(r ≥ 0.90),从而削弱了近期合理使用裁决的安全前提。
记忆并非提取:紧致差分隐私边界与审计盲区
这篇基础性论文表明,在f-DP下,记忆与自适应提取并不相互控制,且没有任何单一审计足以检测所有泄露实例,从而确立了记忆判定需要明确其度量与基线。
生成式AI的阴暗面:威胁与风险
这项前期工作将RLHF和输出过滤器确定为避免逐字 regurgitation 训练段落的机制,确立了锚定论文所表明可通过微调绕过的先前前沿。
大语言模型预训练中的“合理使用”与“合理处理”困境:美国、欧盟与英国版权框架的比较分析
这项比较分析发现,美国、欧盟和英国的版权框架在将合法获取训练数据作为门槛要求方面趋于一致,而欧盟《数字化单一市场版权指令》第4条所规定的文本和数据挖掘选择退出框架在结构上是连贯的,但在分配上存在不足。
哈勃:一套推进大语言模型记忆化研究的模型套件
这篇验证论文介绍了用于受控研究LLM记忆的Hubble模型套件,建立了记忆的下界,并表明标准评估可能无法揭示记忆风险的全部范围。
大语言模型的版权陷阱
这篇竞争性论文提出版权陷阱——即在原创内容中插入虚构条目——以检测大语言模型中对受版权保护材料的使用,并发现最先进的文档级推理方法对不会自然记忆的模型无效,例如中等规模的10亿参数模型。
在公平学习原则下审视大型语言模型设计
这篇竞争性论文提出了一个“公平学习”标准,将关注点从行为输出转向结构性训练决策,并通过对Pythia进行因果分析表明,提高某篇文档的权重并不会显著影响其被记忆的程度。
