SANA-WM:单卡跑动 60s 高清世界模型,线性递归重塑长视频生成
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
本文由 NVIDIA 团队提出 SANA-WM,一个拥有 2.6B 参数的开源 6-DoF 相机控制世界模型。它不仅能生成长达一分钟、720p 分辨率的高保真视频,且在推理效率上实现重大突破,单张 GPU 即可完成一分钟视频生成。
TL;DR
在世界模型(World Models)的研究竞速中,一分钟、720p、高频率 6-DoF 控制成为了衡量“具身智能仿真器”的新标杆。NVIDIA 发布的 SANA-WM 证明了:你并不需要数百张 GPU 才能生成连贯的长视频。通过 Hybrid Linear Transformer (GDN) 架构和精妙的双分支动作控制,SANA-WM 在 2.6B 的参数规模下,不仅实现了精准的相机轨迹遵循,更将推理效率拉升了 36 倍,使单卡(甚至 RTX 5090)实时生成高清长视频成为可能。
痛点深挖:长文视频的“内存陷阱”
目前主流视频生成模型(如 Sora 类 DiT 架构)多依赖 Softmax Attention。在处理 720p、一分钟(约 960 帧)的视频时,Token 数量呈指数级增长。Softmax 注意力的 KV Cache 随长度线性增长,内存占用极易 OOM,计算成本则随长度呈二次方增长。
此外,现有的模型在处理“回访(Revisit)”场景(即相机转了一圈回到原点)时,往往会因为累积误差导致场景形变。如何在有限的算力下,既保持长程一致性,又能精准响应相机轨迹?这是 SANA-WM 要解决的核心命题。
核心方法论:高效长序列建模
1. Hybrid GDN-Softmax:当线性遇到精确
作者提出了 Frame-wise Gated DeltaNet (GDN)。不同于传统的 Token-wise 扫描,SANA-WM 以“帧”为单位进行递归状态更新。
- 线性优势:GDN 具有类似 RNN 的恒定内存代价,适合处理长达一分钟的视频序列。
- 混合补强:由于纯线性注意力对长程精确召回(Exact Recall)能力偏弱,模型每隔 4 层插入一个标准的 Softmax Attention 块,作为“锚点”来锚定空间一致性。

2. 双分支相机控制:从轨迹到像素
为了解决强力压缩(LTX2 VAE)带来的控制精度损失,SANA-WM 采用了“顶天立地”的设计:
- 粗粒度分支 (UCPE):在 Latent 层级捕捉 6-DoF 轨迹的全局结构。
- 细粒度分支 (Plücker Mixing):由于一个 Latent token 对应原始视频中的 8 帧,该分支引入原始采样率下的 Plücker 射线图信息,补偿 VAE 步幅内的微小动作波动。
实验战绩:效率与精准的双栖冠军
在 SANA-WM 推出的 60s 评测基准上,它展现出了惊人的效率:
- 训练成本:仅需 ~213k 公开视频片段,64 张 H100 训练 15 天。相比之下,工业级模型动辄需要数万 GPU 小时。
- 推理性能:22 视频/小时(带 Refiner),比基线 Matrix-Game 快 7 倍,比 LingBot-World 快 36 倍。
- 动作遵循:在 Hard 轨迹测试中(大旋转、剧烈俯仰),其旋转误差(RotErr)和位移误差(TransErr)均为开源模型中最低。

深度洞察:为什么这很重要?
SANA-WM 的出现标志着世界模型进入了**“平民化高保真阶段”**。其核心灵感在于对线性 Transformer 的改造——通过引入 Delta 规则(Delta Rule)和门控机制(Gated),克服了早期线性注意力的退化问题。
更深层的启发:
- 数据质量 > 数量:通过其改进的 VIPE 标注管线,仅用 21 万条高质量标注数据就超过了依赖海量弱监督数据的模型。
- 两阶段解耦:模型先用高效的小参数 Base 生成结构,再用 Refiner 提升纹理。这种“先求准,再求美”的策略,是实现分钟级生成的工程最优解。
总结
作为资深学术主编,我认为 SANA-WM 是对当前“堆算力、堆数据”范式的有力反击。它向学术界传递了一个信号:算法层面的 Inductive Bias(归纳偏置)优化,依然能够带来量级上的效率红利。
(图:SANA-WM 在长程序列中展现出的出色场景持久性与结构稳定性)
