Diffusion Models for Video Generation

Lilian Weng 2026-06-22T15:46:25.072389

视频生成的扩散模型

扩散模型(Diffusion models)在过去几年中已在图像合成领域展现出强大成果。如今,研究社区已开始攻克更艰巨的任务——将其应用于视频生成。这项任务本身就是图像任务的超集(因为图像可视为单帧视频),但更具挑战性,原因在于:

前置阅读:在继续阅读前,请确保已阅读此前关于“什么是扩散模型?”(针对图像生成)的博客文章。

从头构建视频生成模型

首先,我们回顾一下从头设计和训练扩散视频模型的方法——即不依赖预训练图像生成器的方法。

参数化与采样基础

此处我们使用与先前文章略有不同的变量定义,但数学原理相同。设 $\mathbf{x} \sim q_\text{real}$ 为从真实数据分布采样的数据点。现在,我们在时间上逐步添加少量高斯噪声,生成一系列 $\mathbf{x}$ 的带噪变体,记为 ${\mathbf{z}_t \mid t =1 \dots, T}$,随着 $t$ 增大噪声量增加,最终 $q(\mathbf{z}_T) \sim \mathcal{N}(\mathbf{0}, \mathbf{I})$。添加噪声的前向过程是一个高斯过程。令 $\alpha_t, \sigma_t$ 定义该高斯过程的可微噪声调度:

为了表示 $0 \leq s < t \leq T$ 时的 $q(\mathbf{z}_t \vert \mathbf{z}_s)$,我们有:
[
]
设对数信噪比为 $\lambda_t = \log[\alpha^2_t / \sigma^2_t]$,我们可以将 DDIM (Song et al. 2020) 更新表示为:
[
]
存在一种特殊的 $\mathbf{v}$-预测($\mathbf{v} = \alpha_t \boldsymbol{\epsilon} - \sigma_t \mathbf{x}$)参数化方法,由 Salimans & Ho (2022) 提出。已有研究表明,与 $\boldsymbol{\epsilon}$-参数化相比,这种方法有助于避免视频生成中的颜色偏移问题。

$\mathbf{v}$-参数化是通过角度坐标的巧妙技巧推导得出的。首先,定义 $\phi_t = \arctan(\sigma_t / \alpha_t)$,因此有 $\alpha_\phi = \cos\phi, \sigma_t = \sin\phi, \mathbf{z}\phi = \cos\phi \mathbf{x} + \sin\phi\boldsymbol{\epsilon}$。$\mathbf{z}\phi$ 的速度可写为:
[
]
然后我们可以推断:
[
]
DDIM 更新规则相应更新为:

(Salimans & Ho, 2022)

模型中 $\mathbf{v}$-参数化的预测目标是 $\mathbf{v}_\phi = \cos\phi\boldsymbol{\epsilon} -\sin\phi\mathbf{x} = \alpha_t\boldsymbol{\epsilon} - \sigma_t\mathbf{x}$。

在视频生成中,扩散模型需要执行多个上采样步骤来扩展视频长度或提高帧率。这就要求模型能够以第一个视频 $\mathbf{x}^a$ 为条件采样第二个视频 $\mathbf{x}^b$,即 $\mathbf{x}^b \sim p_\theta(\mathbf{x}^b \vert \mathbf{x}^a)$,其中 $\mathbf{x}^b$ 可以是 $\mathbf{x}^a$ 的自回归扩展,也可以是低帧率视频 $\mathbf{x}^a$ 中缺失的中间帧。

采样 $\mathbf{x}b$ 时,除了依赖于其自身的带噪变量外,还需要以 $\mathbf{x}_a$ 为条件。视频扩散模型 (VDM; Ho & Salimans, et al. 2022) 提出使用调整后的去噪模型进行重建引导(reconstruction guidance),使得 $\mathbf{x}^b$ 的采样能够正确以 $\mathbf{x}^a$ 为条件:
[
]
其中 $\hat{\mathbf{x}}^a
\theta (\mathbf{z}t), \hat{\mathbf{x}}^b\theta (\mathbf{z}_t)$ 是去噪模型提供的对 $\mathbf{x}^a, \mathbf{x}^b$ 的重建结果。$w_r$ 是权重因子,较大的 $w_r >1$ 有助于提高样本质量。注意,同样可以使用相同的重建引导方法,以低分辨率视频为条件,将样本扩展至高分辨率。

模型架构:3D U-Net 与 DiT

与文本到图像的扩散模型类似,U-net 和 Transformer 仍然是两种常见的架构选择。谷歌发布了一系列基于 U-net 架构的扩散视频模型论文,而 OpenAI 最近的 Sora 模型则采用了 Transformer 架构。

VDM (Ho & Salimans, et al. 2022) 采用标准的扩散模型设置,但修改了架构以适配视频建模。它将2D U-net 扩展为适用于3D数据 (Cicek et al. 2016),其中每个特征图表示一个4D张量:帧数 × 高度 × 宽度 × 通道数。这种3D U-net 在空间和时间维度上进行分解,即每个层只对空间或时间维度操作,而非两者同时:


(Salimans & Ho, 2022)

Imagen Video (Ho, et al. 2022) 建立在级联扩散模型之上,以提高视频生成质量,并升级为输出1280x768分辨率、24帧/秒的视频。Imagen Video 架构包含以下组件,共计7个扩散模型:


(Ho et al. 2022)

基础去噪模型在所有帧上同时执行空间操作(共享参数),然后时间层跨帧混合激活值,以更好地捕获时间连贯性。这被证明比帧自回归方法效果更好。


(Ho et al. 2022)

SSR 和 TSR 模型都以通道方式将上采样输入与带噪数据 $\mathbf{z}_t$ 拼接作为条件。SSR 通过双线性调整大小进行上采样,而 TSR 通过重复帧进行上采样。

查看原文