Deep Delta Learning:让 Transformer 的残差流从“只加不减”走向“精准重写”

Deep Delta Learning

2026-01-01
Yifan Zhang, Yifeng Liu, Mengdi Wang, Quanquan Gu
总结
问题
方法
结果
要点
摘要

本文提出了 Deep Delta Learning (DDL),一种全新的 Transformer 残差连接机制。它将传统的“加法累加”更新规则重构为基于 Delta-rule 的“读-写-擦除”操作,允许模型在保持恒等路径的同时,能够选择性地重写或覆盖残差流中已过时的信息。

TL;DR

在传统的 Transformer 中,残差流(Residual Stream)就像一个只能不断叠加的记事本,信息只能被“加”进去,却很难被“擦除”。普林斯顿和 UCLA 的研究者提出的 Deep Delta Learning (DDL) 改变了这一现状。它引入了一种基于 Delta-rule 的更新机制,赋予了每一层网络“精准覆盖”旧信息的能力。实验显示,在不增加核心计算量的前提下,DDL 显著提升了语言模型的建模精度和下游任务表现。

痛点深挖:ResNet 的遗产与 Transformer 的枷锁

自 ResNet 诞生以来, 成了深度学习的黄金法则。在 Transformer 中,这意味着所有 Attention 和 MLP 层的输出都会被简单地加到残差流中。

然而,这种纯加法累加存在一个严重的物理直觉缺陷:如果模型在第 5 层产生了一个后来被证明是错误的推论,第 6 层无法直接“删掉”它。模型必须通过复杂的向量运算,产生一个抵消信号来中和旧信息,同时写入新信息。这种逻辑上的繁琐增加了模型管理的难度。

核心直觉:深度方向上的 Delta Rule

作者受序列模型(如 DeltaNet)的启发,将通常用于循环神经网络(RNN)时间步更新的 Delta Rule 搬到了神经网络的深度维度上。

1. 读-比较-写 (Read-Compare-Write) 机制

DDL 的核心公式如下:

  • (方向):模型决定要在残差空间的哪一个维度进行编辑。
  • (差值):计算目标值与当前选定方向上内容的差异。
  • (门控):同步控制“擦除”旧内容和“写入”新内容的强度。

时,旧的方向分量被完全抹除,代之以新的 。这实现了从“盲目加法”到“语义覆盖”的跃迁。

模型架构图 图 1: DDL 概览。左图展示了 gated rank-1 重写操作,右图展示了 DDL Transformer 的整体结构。

2. 存储与计算的解耦:扩展残差状态

DDL 进一步提出了 Expanded Residual State。通常 Transformer 的残差流宽度 与计算宽度一致,而 DDL 可以让残差流拥有 的空间(例如 )。

  • Compress (压缩):将庞大的残差流投影回 维进入 Attention 层。
  • Process (处理):标准计算,维持原有的计算复杂度。
  • Rewrite (重写):将计算结果更新回 的存储空间。 这种设计让模型拥有了更肥沃的“记忆土壤”,而不必增加昂贵的注意力计算开销。

实验与结果:小参数下的“降维打击”

研究团队在 GPT-2 Small (124M) 和 Medium (353M) 规模上进行了严格的受控实验。

关键战绩

  • 验证集 Loss:在 Medium 规模下,DDL-CC (Channel-axis Compression) 变体将训练 Loss 从 2.605 降低到了 2.576,提升效果极为显著。
  • 推理效率:虽然引入了扩展状态,但通过优化的通道维卷积压缩(DDL-CC),其推理速度仍保持在基线的 75% 以上,内存占用仅增加约 2%-5%。

实验结果对比 图 2: 不同 DDL 变体在 Medium 规模下的训练曲线。可以看到 DDL-CC (蓝色) 持续优于基线。

在下游任务 1-shot 评测中,DDL 在 ARC-E、SciQ 等逻辑推理类问题上表现尤为突出,平均得分提升了超过 1 个百分点。

深度洞察:为什么 DDL 有效?

DDL 的本质是引入了一种可学习的线性代数算子。从光谱分析(Spectral Analysis)可见,DDL 实际上在选定的特征方向上执行了一个算子

  1. 时,它是恒等变换(Identity),保证了深层网络易于训练。
  2. 时,它是正交投影,实现内容替换。
  3. 时,它变成了豪斯霍尔德变换(Householder Transformation),实现内容的镜像反射。

这种比纯加法更丰富的几何变换能力,使得每一层都能更高效地清理残差流中的噪音,保持信息的“纯净度”。

总结与局限

Deep Delta Learning 成功地向我们展示了:即使是像残差连接这样“神圣不可侵犯”的基石,依然存在巨大的优化空间。它不仅提升了模型性能,还为残差流的动态管理提供了理论支撑。

局限性:在大规模(10B+ 参数)模型上的扩展性仍需验证,且扩展残差状态()在 KV Cache 之外引入了一定额度的额外存储开销,这在显存敏感的场景下需要权衡。

展望:DDL 的设计理念非常契合当前追求“无限长上下文”的趋势。如果能将残差流看作一种动态更新的外部存储,Transformer 的推理深度和广度或许将迎来新的突破。

发现相似论文

试试这些示例

  • 查找其他通过引入 Gate 机制或非线性变换来改进 Transformer 残差连接(Residual Stream)的最新论文。
  • 哪篇论文最早在序列建模中提出了 Delta Rule 内存更新机制(如 DeltaNet),本文如何将其推广到深度方向?
  • 研究如何将类似 DDL 的扩展残差状态(Expanded Residual State)应用到线性注意力(Linear Attention)或 SSM 架构中以增强其记忆能力。
目录
Deep Delta Learning:让 Transformer 的残差流从“只加不减”走向“精准重写”
1. TL;DR
2. 痛点深挖:ResNet 的遗产与 Transformer 的枷锁
3. 核心直觉:深度方向上的 Delta Rule
3.1. 1. 读-比较-写 (Read-Compare-Write) 机制
3.2. 2. 存储与计算的解耦:扩展残差状态
4. 实验与结果:小参数下的“降维打击”
4.1. 关键战绩
5. 深度洞察:为什么 DDL 有效?
6. 总结与局限