SANA-WM:单卡跑动 60s 高清世界模型,线性递归重塑长视频生成

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

2026-01-01
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie
总结
问题
方法
结果
要点
摘要

本文由 NVIDIA 团队提出 SANA-WM,一个拥有 2.6B 参数的开源 6-DoF 相机控制世界模型。它不仅能生成长达一分钟、720p 分辨率的高保真视频,且在推理效率上实现重大突破,单张 GPU 即可完成一分钟视频生成。

TL;DR

在世界模型(World Models)的研究竞速中,一分钟、720p、高频率 6-DoF 控制成为了衡量“具身智能仿真器”的新标杆。NVIDIA 发布的 SANA-WM 证明了:你并不需要数百张 GPU 才能生成连贯的长视频。通过 Hybrid Linear Transformer (GDN) 架构和精妙的双分支动作控制,SANA-WM 在 2.6B 的参数规模下,不仅实现了精准的相机轨迹遵循,更将推理效率拉升了 36 倍,使单卡(甚至 RTX 5090)实时生成高清长视频成为可能。


痛点深挖:长文视频的“内存陷阱”

目前主流视频生成模型(如 Sora 类 DiT 架构)多依赖 Softmax Attention。在处理 720p、一分钟(约 960 帧)的视频时,Token 数量呈指数级增长。Softmax 注意力的 KV Cache 随长度线性增长,内存占用极易 OOM,计算成本则随长度呈二次方增长。

此外,现有的模型在处理“回访(Revisit)”场景(即相机转了一圈回到原点)时,往往会因为累积误差导致场景形变。如何在有限的算力下,既保持长程一致性,又能精准响应相机轨迹?这是 SANA-WM 要解决的核心命题。


核心方法论:高效长序列建模

1. Hybrid GDN-Softmax:当线性遇到精确

作者提出了 Frame-wise Gated DeltaNet (GDN)。不同于传统的 Token-wise 扫描,SANA-WM 以“帧”为单位进行递归状态更新。

  • 线性优势:GDN 具有类似 RNN 的恒定内存代价,适合处理长达一分钟的视频序列。
  • 混合补强:由于纯线性注意力对长程精确召回(Exact Recall)能力偏弱,模型每隔 4 层插入一个标准的 Softmax Attention 块,作为“锚点”来锚定空间一致性。

模型架构图

2. 双分支相机控制:从轨迹到像素

为了解决强力压缩(LTX2 VAE)带来的控制精度损失,SANA-WM 采用了“顶天立地”的设计:

  • 粗粒度分支 (UCPE):在 Latent 层级捕捉 6-DoF 轨迹的全局结构。
  • 细粒度分支 (Plücker Mixing):由于一个 Latent token 对应原始视频中的 8 帧,该分支引入原始采样率下的 Plücker 射线图信息,补偿 VAE 步幅内的微小动作波动。

实验战绩:效率与精准的双栖冠军

在 SANA-WM 推出的 60s 评测基准上,它展现出了惊人的效率:

  • 训练成本:仅需 ~213k 公开视频片段,64 张 H100 训练 15 天。相比之下,工业级模型动辄需要数万 GPU 小时。
  • 推理性能22 视频/小时(带 Refiner),比基线 Matrix-Game 快 7 倍,比 LingBot-World 快 36 倍。
  • 动作遵循:在 Hard 轨迹测试中(大旋转、剧烈俯仰),其旋转误差(RotErr)和位移误差(TransErr)均为开源模型中最低。

实验结果对比


深度洞察:为什么这很重要?

SANA-WM 的出现标志着世界模型进入了**“平民化高保真阶段”**。其核心灵感在于对线性 Transformer 的改造——通过引入 Delta 规则(Delta Rule)和门控机制(Gated),克服了早期线性注意力的退化问题。

更深层的启发:

  1. 数据质量 > 数量:通过其改进的 VIPE 标注管线,仅用 21 万条高质量标注数据就超过了依赖海量弱监督数据的模型。
  2. 两阶段解耦:模型先用高效的小参数 Base 生成结构,再用 Refiner 提升纹理。这种“先求准,再求美”的策略,是实现分钟级生成的工程最优解。

总结

作为资深学术主编,我认为 SANA-WM 是对当前“堆算力、堆数据”范式的有力反击。它向学术界传递了一个信号:算法层面的 Inductive Bias(归纳偏置)优化,依然能够带来量级上的效率红利。

需替换为生成效果图 (图:SANA-WM 在长程序列中展现出的出色场景持久性与结构稳定性)

发现相似论文

试试这些示例

  • 查找在视频生成领域中,除了 Gated DeltaNet (GDN) 以外,还有哪些结合了线性注意力和 Softmax 注意力的最新混合架构研究?
  • 相机位置编码(UCPE)最初是在哪篇论文中提出的,它是如何通过几何约束增强视频生成的平滑性的?
  • 探究 SANA-WM 的双阶段优化管线(Two-Stage Refiner)是否可以被应用到自动驾驶仿真领域,以增强其长视野下的一致性?
目录
SANA-WM:单卡跑动 60s 高清世界模型,线性递归重塑长视频生成
1. TL;DR
2. 痛点深挖:长文视频的“内存陷阱”
3. 核心方法论:高效长序列建模
3.1. 1. Hybrid GDN-Softmax:当线性遇到精确
3.2. 2. 双分支相机控制:从轨迹到像素
4. 实验战绩:效率与精准的双栖冠军
5. 深度洞察:为什么这很重要?
5.1. 总结