MambaIR:突破计算困局,开启图像恢复的线性全局建模时代

Mambair: A simple baseline for image restoration with state-space model

Hang Guo, Jinmin Li, Tao Dai, Zhihao Ouyang, Xudong Ren, Shu-Tao Xia
总结
问题
方法
结果
要点
摘要

本文提出了 MambaIR,这是首个将选择性结构化状态空间模型(Mamba)引入图像恢复(Image Restoration)任务的基准模型。通过这一架构,MambaIR 在保持线性计算复杂度的同时实现了全局感受野,在图像超分辨率(SR)和去噪任务上达到了 SOTA 性能。

TL;DR

在图像恢复领域,我们长期在 CNN 的效率与 Transformer 的全局性能之间做折中。本文提出的 MambaIR 彻底打破了这一僵局,利用 State-Space Model (SSM) 的线性复杂度实现了真正的全局感受野,在超分与去噪任务上全面超越经典 SwinIR,且计算成本极具竞争力。

背景:感受野的“昂贵”代价

图像恢复(Image Restoration)的核心在于利用上下文信息重建像素。

  • CNN:依靠算子并行,但有效感受野(Effective Receptive Field)极度局限。
  • Transformer:拥有全局视野,但其 Self-Attention 的复杂度是 。为了实用,SwinIR 等模型不得不采用 Shifted Window,但这实际上是“牺牲全局性换取效率”的妥协。

Mamba 的出现改变了游戏规则,它通过选择性扫描机制,在 复杂度下实现了对长距离依赖的建模。但在图像这种 2D 非因果数据上,简单套用 1D Mamba 会遇到:

  1. 局部像素遗忘:展平后的 1D 序列让本该相邻的像素在空间上变得遥远。
  2. 通道冗余:为了记忆长序列,SSM 往往产生大量重复的特征表达。

核心创新:Residual State-Space Block (RSSB)

为了将 Mamba 调教成适合底层视觉的“利器”,作者设计了核心模块 RSSB。其架构流程为:Norm -> VSSM -> Local Conv -> Channel Attention

1. 2D 扫描与全局感知

模型采用了四向选择性扫描(Selective Scan Module),从左上、右下、右上、左下四个顶点出发遍历图像。这确保了图像中的每一个像素都能从四个方向“吸收到”全图的上下文。

模型架构图 图 1:MambaIR 总体架构及 RSSB 内部细节

2. 局部增强与去冗余

  • 局部卷积 (Local Conv):在 VSSM 之后串联一个瓶颈结构的深度卷积,强行召回因展平而丢失的邻域空间先验。
  • 通道注意力 (CA):通过动态加权,过滤掉 SSM 中低效的冗余特征,强制模型学习更具判别力的表示。

消融实验展示 图 2:可视化证明,Channel Attention 有效缓解了 Mamba 输出中的通道失活问题。

实验战绩:全线刷新 SOTA

在经典超分辨率 (Classic SR) 榜单上,MambaIR 展示了统治级的表现:

  • 精度提升:在 Manga109 数据集上,x2 倍率下比 SwinIR 高出 0.41dB
  • 视觉质量:相比 CNN 和基于窗口的 Transformer,MambaIR 恢复出的线条更锐利,没有人工伪影(Artifacts)。

实验结果对比 图 3:与 SwinIR 的视觉对比,MambaIR 在处理高密度纹理时更符合物理直觉。

深度洞察

MambaIR 的成功证明了一个深刻的直觉:底层视觉同样需要全局注意力,但不一定需要全量 Self-Attention。

论文中一个有趣的观察是,单纯将 MLP 替换进 MambaIR 反而会导致性能下降,这说明 SSM 模块与 Transformer 的 MLP/Attention 范式有着完全不同的归纳偏置(Inductive Bias)。Mamba 实际上更像是一个带有“选择性记忆”的循环神经网络,这使其在处理具有重复纹理特征的图像时(如 Urban100 中的建筑线条),展现出比 Transformer 强得多的建模能力。

总结与展望

MambaIR 不仅仅是一个新的 Baseline,它标志着图像恢复任务进入了“线性全局建模”时代。 局限性:尽管 MACs(计算量)较低,但目前 Mamba 在某些硬件上的推理算子优化尚不如成熟的卷积或自注意力层稳定,实际速度仍有优化空间。 展望:未来将 Mamba 扩展到多帧视频恢复或处理 4K/8K 超高清图像,将是该技术路线真正发挥其“线性优势”的战场。

发现相似论文

试试这些示例

  • 查找最近一年内将 Mamba 架构应用于视频超分辨率或其它实时视频恢复任务的研究论文。
  • 哪篇论文最早提出了 Vision Mamba (VMamba) 的多向扫描机制,本文在 RSSB 模块中对其做了哪些针对图像恢复任务的改进?
  • 对比分析 MambaIR 与带窗口限制的 Transformer(如 SwinIR)在处理超大尺寸图像(如 4K/8K)时的计算效率及显存占用实验。
目录
MambaIR:突破计算困局,开启图像恢复的线性全局建模时代
1. TL;DR
2. 背景:感受野的“昂贵”代价
3. 核心创新:Residual State-Space Block (RSSB)
3.1. 1. 2D 扫描与全局感知
3.2. 2. 局部增强与去冗余
4. 实验战绩:全线刷新 SOTA
5. 深度洞察
6. 总结与展望