摘要

本文解读 NeurIPS 2025(Oral)论文《Why Diffusion Models Don't Memorize: The Role of Implicit Dynamical Regularization in Training》(扩散模型为何不失忆:训练中的隐式动力学正则化)。该论文提出双时间尺度理论——扩散模型训练中先泛化($\tau_{\mathrm{gen}}$)、后记忆化($\tau_{\mathrm{mem}}$),通过融合随机特征谱分析U-Net 大规模实验高斯混合受控实验,证明记忆化时间随训练集规模 $n$ 线性增长而泛化时间恒定,其特别之处在于用随机矩阵理论严格导出了"训练动力学即隐式正则化"的机制。实验表明早停窗口 $[\tau_{\mathrm{gen}},\tau_{\mathrm{mem}}]$ 随数据量线性加宽($n=1024$ 时 190K 步 FID 35.1 且零记忆化,过训练至 1.62M 步则记忆化比例达 47.2%),为生成式 AI 的数据稀缺场景提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Why Diffusion Models Don't Memorize: The Role of Implicit Dynamical Regularization in Training
标题(中文)扩散模型为何不失忆:训练中的隐式动力学正则化
作者Tony Bonnaire, Raphaël Urfin, Giulio Biroli, Marc Mézard
机构LPENS, Université PSL, Paris · Bocconi University, Milano
会议NeurIPS 2025 (Oral)
arXivhttps://arxiv.org/abs/2505.17638
项目网站https://github.com/tbonnair/Why-Diffusion-Models-Don-t-Memorize

背景与动机:为什么扩散模型"记得住"训练数据?

扩散模型(Diffusion Models)已经成为图像、音频、视频乃至科学数据生成的主流范式,但一个根本性问题始终悬而未决:模型为什么没有把训练集"背下来"? 理论上,一个无正则化的模型只要把训练损失压到零,就会学到经验 score 函数,在逆扩散采样的终点必然复现训练样本——这正是记忆化(memorization)的教科书定义。然而在实践中,记忆化只在小数据集上被观察到,当训练集规模 $n$ 超过某个与模型相关的阈值后便消失,这一"泛化—记忆化转变"的成因长期缺乏严格解释。

记忆化研究的演进脉络(论文附录 H 提供了完整历史视角):

阶段代表性工作贡献
2020DDPM(Ho et al., NeurIPS 2020)扩散模型成为主流生成范式,引出泛化/记忆化之问
2022–2023Somepalli(ICCV 2023)、Carlini(USENIX Security 2023)实证证明 Stable Diffusion 等工业模型可复现训练数据中的图像
2024–2025Biroli et al.(2024)、George et al.(2025)高维极限下用经验 score / 随机特征模型刻画渐近记忆化
2025本文(NeurIPS 2025 Oral)从"是否会记忆化"推进到"何时记忆化"——动力学标度律

在已有工作中,架构容量(Kadkhodaie et al., ICLR 2024 的几何自适应谐波表示)与学习率有限性(Wu et al., 2025 的数值正则化)都被认为是隐式正则化的来源,但这些机制全部存在时,泛化—记忆化转变依然出现,说明核心机制另有其主。本文的创新之处(附录 E 的 Oral 信号分析)恰好对应三条被证实的创新模式:P6 重述为可解对象——把"是否记忆化"重述为两个时间尺度的标度律并用随机矩阵理论严格求解;P4 受控实验隔离变量——逐项隔离 $n$、容量 $p$、批量 $B$ 与优化器;P1 扭转负载假设——用谱偏置推翻"记忆化由样本重复驱动"的隐含假设。

研究主线:从问题到结论

扩散模型记忆化研究主线:从问题、假说到谱分析验证的流程(Mermaid 流程图)

图 7:研究主线(Mermaid 流程图):扩散模型为何不失忆 → 双时间尺度假说 → 随机特征可解模型 → 谱分析两定理 → 三方验证 → 早停窗口结论。

基准/方法设计:双时间尺度与三阶段图景

作者在全文开篇给出了一张总览图,把训练动力学划分为三个由训练时间 $\tau$ 区分的阶段:泛化阶段($\tau < \tau_{\mathrm{gen}}$,生成质量快速提升)、早停窗口($\tau \in [\tau_{\mathrm{gen}}, \tau_{\mathrm{mem}}]$,高质量且零记忆化)、记忆化阶段($\tau > \tau_{\mathrm{mem}}$,生成样本逐渐复现训练集)。两个关键标度律是:$\tau_{\mathrm{gen}}$ 与训练集规模 $n$ 无关(约 100K 步),而 $\tau_{\mathrm{mem}} \propto n$ 线性增长——这直接创造了一个随数据量加宽的泛化窗口

扩散模型训练动力学三阶段总览:泛化窗口随训练集规模增宽

图 1:训练动力学三阶段示意(左),泛化窗口 $[\tau_{\mathrm{gen}},\tau_{\mathrm{mem}}]$ 随 $n$ 增大而加宽;以及 $(n,p)$ 平面上的三区域相图(右):记忆化区、架构正则化区与动力学正则化区。

机制上,作者将其归因于经验 score 的谱偏置(spectral bias):低噪声区域的真实 score 与经验 score 共享低频部分,而高频部分是数据集特有的。神经网络的平滑插值先逼近总体 score(低频主导),需要极长的训练时间才会塌向经验 score(高频主导),从而推迟记忆化。这正是 Rahaman et al.(ICML 2019)谱偏置理论在 score 学习中的首次系统性应用。

分类全景:隐式正则化的三类来源

扩散模型避免记忆化的三类隐式正则化来源:架构、数值与动力学(Mermaid 流程图)

图 8:隐式正则化来源分类(Mermaid 流程图):架构正则化(容量受限/几何自适应谐波)、数值正则化(学习率有限性)与本文的动力学正则化(训练时间尺度)。

方法细节:随机特征谱分析如何严格导出两个时间尺度

理论部分(附录 D 给出推导要点)采用随机特征神经网络(RFNN)拟合 score:$\mathbf{s}_{\mathbf{A}}(\mathbf{x})=\mathbf{A}\sigma(\mathbf{W}\mathbf{x}/\sqrt{d})/\sqrt{p}$,第一层权重冻结、第二层梯度下降。在高维极限($d,p,n\to\infty$,$\psi_p=p/d$、$\psi_n=n/d$ 固定)下,梯度流对第二层权重是线性的,可闭式求解——训练时间尺度恰好等于特征相关矩阵 $\Delta_t\mathbf{U}/\psi_p$ 的特征值倒数,问题由此转化为随机矩阵谱分析。

随机特征网络示意图与特征相关矩阵的特征值谱

图 2:$\mathbf{U}$ 的特征值谱(过参数化情形):蓝色第一 bulk $\rho_1$(决定 $\tau_{\mathrm{mem}}$)与橙色 bulk $\rho_2$(决定 $\tau_{\mathrm{gen}}$)在 $\psi_p\gg\psi_n$ 时完全分离;$\lambda=s_t^2$ 处的 delta 峰不影响损失。

论文给出两个定理(Theorem 1/2,证明见附录):定理一利用副本方法(replica method)与高斯等价原理(GEP)导出谱的 Stieltjes 变换满足的紧致鞍点方程组,对任意数据协方差成立;定理二给出谱分解——过参数化($\psi_p>\psi_n$)时谱 = delta 峰 $s_t^2$ + bulk $\rho_1$ + bulk $\rho_2$,欠参数化时只剩两个 bulk。由此得到核心标度律:

  • 泛化时间 $\tau_{\mathrm{gen}} \sim 1/\Delta_t$:由 bulk $\rho_2$ 决定,仅依赖总体协方差 $\boldsymbol{\Sigma}$,与训练集实现无关;
  • 记忆化时间 $\tau_{\mathrm{mem}} \sim \psi_p/\Delta_t\lambda_{\min} \propto \psi_n$:由 bulk $\rho_1$ 的左边缘 $\lambda_{\min}$ 决定,随 $n$ 线性增长
  • 架构阈值 $n^*(p) \approx p$:当数据量超过参数规模,模型在无限训练下也不记忆化。

随机特征模型中 score 距离随训练时间的演化与重标度塌缩

图 3:RFNN 中 score 距离 $\mathcal{E}{\mathrm{score}}$ 随训练时间演化:不同 $\psi_n$ 的曲线在 $\tau/\tau{\mathrm{mem}}$ 重标度后塌缩(inset),证实 $\tau_{\mathrm{mem}}\propto n$ 的理论预言。

推导的关键技术(附录 D):高斯等价原理把非线性激活 $\sigma(\mathbf{W}\mathbf{x}/\sqrt{d})$ 替换为线性项 $\kappa_1\mathbf{W}\mathbf{x}'/\sqrt{d}$ 加高斯噪声 $\kappa_*\boldsymbol{\eta}$,使谱性质与高斯协变量模型等价;过参数化极限下两个 bulk 支集分别位于 $\psi_p/\psi_n$ 与 $\psi_p$ 尺度,完全分离。所有证明可由自由随机矩阵理论(George et al., 2025 的严格路线)替代副本方法加以严格化。

实验设计与结果:CelebA、GMM 与理论三方互证

评测协议

主实验在 CelebA 人脸数据集上进行:图像中心裁剪至 $32\times32$ 灰度,训练集规模 $n \in [128, 32768]$,无数据增强;模型为标准 DDPM U-Net(三层分辨率、每层两个残差块、最粗两层加注意力、正弦时间位置嵌入),通过基宽 $W\in{8,16,32,48,64}$ 扫描参数量 $p \in {0.26, 1, 4, 9, 16}\times10^6$。训练使用带动量 SGD($\eta=0.01$,$B=\min(n,512)$,至少 2M 步),采样用 DDIM($T'=200$,每次生成 10K 样本)。两个核心指标:FID(5 次独立测试集的 2 倍标准差误差棒)衡量生成质量;记忆化比例 $f_{\mathrm{mem}}$(最近邻距离比 $k=1/3$ 准则,并验证 $k\in{1/4,1/2}$ 不敏感)衡量复现训练数据的程度。计算资源:18 个模型在 H100 双卡上训练,2M 步约 50 小时,最长 11M 步。

三方结果对比

现象CelebA U-NetGMM ResNetRFNN 理论
$\tau_{\mathrm{gen}}$ 与 $n$ 无关≈100K 步KL 先降至 ≈0$\sim 1/\Delta_t$
$\tau_{\mathrm{mem}} \propto n$$\tau/n$ 塌缩$\tau/n$ 塌缩$\psi_n/\Delta_t$
$\tau_{\mathrm{mem}} \propto W^{-1}$更大 $W$ 更早记忆化$\tau_{\mathrm{mem}} \propto W^{-1}$
泛化窗口$f_{\mathrm{mem}}=0$ 窗口$D_{\mathrm{KL}}\approx0$ 窗口$\mathcal{L}_{\mathrm{gen}}\approx0$
反例排除$B=n$ 全批量仍成立Adam 同两阶段

核心结果:记忆化转变曲线

CelebA U-Net 上的记忆化转变:FID 与记忆化比例随训练时间演化

图 4:CelebA U-Net 上的记忆化转变:FID(实线)在 $\tau_{\mathrm{gen}}\approx100$K 处达最小且不随 $n$ 移动;$f_{\mathrm{mem}}$(虚线)在 $\tau_{\mathrm{mem}}$ 处升起,inset 中 $\tau/n$ 重标度后所有曲线塌缩。

左图是全文最重要的实验证据:FID 实线在约 100K 步到达最小值且不随 $n$ 移动;记忆化比例虚线在更晚的 $\tau_{\mathrm{mem}}$ 处才开始上升,用 $\tau/n$ 重标度后所有曲线完美塌缩——$\tau_{\mathrm{mem}}\propto n$ 的直接验证。右图显示训练损失与测试损失的分叉点同样随 $n$ 推迟。

反直觉实验:记忆化不是样本重复造成的(附录 B)

两个关键对照实验排除了最自然的替代解释:

  1. 全批量训练($B=n$):任意固定 $\tau$ 下每个样本恰好被看过 $\tau$ 次,样本重复程度与 $n$ 完全无关,但 $\tau_{\mathrm{mem}}$ 依然随 $n$ 线性增长——证明推迟记忆化的是损失景观随数据量的结构性变化,而非重复次数。
  2. Adam 优化器:$W=64$、$\eta=10^{-4}$ 下复现完全相同的两阶段动力学与 $\tau_{\mathrm{mem}}\propto n$ 标度,只是两个时间尺度都发生在少得多的步数内。

容量效应与相图

容量扫描显示:网络越宽($W$ 越大),生成质量越好但记忆化越早,而泛化时间满足普适塌缩 $W\tau_{\mathrm{gen}} \approx 3\times10^6$。在 $(n,p)$ 相图上(图 5),三条曲线分别给出早停在 $\tau_{\mathrm{gen}}$、$3\tau_{\mathrm{gen}}$、$8\tau_{\mathrm{gen}}$ 时 $f_{\mathrm{mem}}=0$ 的最小数据规模——训练时间越长,需要的安全数据量越大;早停边界远低于无限训练边界,正是动力学正则化扩展泛化区域的直观体现。

数据量与参数规模相图:早停窗口随训练时间移动

图 5:$(n,p)$ 相图:三条曲线给出 $\tau\in{\tau_{\mathrm{gen}},3\tau_{\mathrm{gen}},8\tau_{\mathrm{gen}}}$ 时 $f_{\mathrm{mem}}=0$ 的最小 $n(p)$;阴影区为记忆化-泛化边界随训练时间的移动。

受控 GMM 实验与条件生成(附录 C)

为了排除 U-Net 与自然图像的偶然性,作者在双高斯混合分布($\mathbb{P}0=\frac{1}{2}\mathcal{N}(\pm\boldsymbol{\mu},\mathbf{I}_d)$)上训练轻量 ResNet score 模型($d=8$,$W=128$,共 102,024 参数)。该设定下泛化 score 有解析表达式,可直接测量生成分布与真实分布的 KL 散度。结果与自然图像完全一致:KL 散度先降至接近零($\tau{\mathrm{gen}}$ 与 $n$ 无关),随后在 $\tau_{\mathrm{mem}}\propto n$ 处回升;宽度增大时 $\tau_{\mathrm{mem}}$ 按 $W^{-1}$ 收缩。作者还验证了 classifier-free guidance 条件生成版本,$\tau/n$ 重标度后 $n\in{256,512,1024}$ 曲线完全塌缩——条件设定下规律依然成立。

定性案例:泛化与记忆化的视觉对比(附录 A)

CelebA 训练图像与不同训练时长的生成样本对比

图 6:CelebA 训练与生成样本($n=1024$, $W=32$):左块为训练图;中块 $\tau=190$K 时生成图与其最近邻明显不同(泛化,$f_{\mathrm{mem}}=0\%$);右块 $\tau=1.62$M 时大量复现训练图($f_{\mathrm{mem}}=47.2\%$)。

同一个模型($n=1024$,$W=32$):训练 190K 步时生成的图像与最近邻训练图像明显不同($f_{\mathrm{mem}}=0\%$,FID 35.1);训练到 1.62M 步后,47.2% 的生成样本复现训练图像——泛化与记忆化的对比一目了然。

结果对比总结

双时间尺度到早停窗口与过训练风险的结果链(Mermaid 流程图)

图 9:结果对比总结(Mermaid 流程图):$\tau_{\mathrm{gen}}$ 恒定与 $\tau_{\mathrm{mem}}\propto n$ 共同决定早停窗口,窗口内 $f_{\mathrm{mem}}=0\%$ 且 FID 最优 35.1,过训练则记忆化比例升至 47.2%。

关键发现

  1. 双时间尺度普遍成立:$\tau_{\mathrm{gen}}$(≈100K 步)与 $n$ 无关,$\tau_{\mathrm{mem}}$ 随 $n$ 线性增长——在 CelebA U-Net($n\in[128,32768]$)、GMM ResNet 与随机特征理论三个设定中定量一致。
  2. 谱偏置是机制根源:低噪声经验 score 的高频部分是数据集特有的,网络平滑插值先逼近总体 score,需极长训练时间才塌向经验 score——这与 Rahaman 谱偏置理论一致。
  3. 全批量实验排除样本重复解释:$B=n$ 时每个样本被看到次数完全一致,$\tau_{\mathrm{mem}}\propto n$ 依然成立,证明损失景观随 $n$ 重塑。
  4. 容量与时间存在普适塌缩:$W\tau_{\mathrm{gen}} \approx 3\times10^6$;$\tau_{\mathrm{mem}}$ 随 $W^{-1}$ 收缩。
  5. 早停窗口量化:$n=1024$ 时 190K 步即达 FID 35.1 且 $f_{\mathrm{mem}}=0\%$,而 1.62M 步时 $f_{\mathrm{mem}}=47.2\%$。
  6. 条件生成与 Adam 同样成立:classifier-free guidance 版本 $\tau/n$ 塌缩完美;Adam 复现双阶段但步数少得多。

局限性

  • 优化器泛化性:主结果基于 SGD;Adam 复现了双阶段与 $\tau_{\mathrm{mem}}\propto n$,但步数显著更少,时间尺度的定量平移尚未刻画。
  • 无条件生成为主:条件扩散仅在高斯混合玩具数据上验证;真实条件模型的绝对时间尺度仍开放。
  • 容量覆盖有限:$p$ 仅覆盖 1M–16M,完整 $(n,p)$ 相图(尤其大容量区)尚未绘制。
  • 理论模型受控:随机特征 + 高斯数据复现了核心效应;重尾分布、隐流形数据与结构化架构仍需研究。

常见问题(FAQ)

扩散模型为什么会记忆化训练数据?

当训练集规模 $n$ 较小时,模型有足够容量把训练损失压到零,学到经验 score 函数;逆扩散采样终点会不可避免地复现训练样本。这正是 Biroli et al.(2024)与 George et al.(2025)在高维极限下严格刻画的现象。

记忆化时间为什么随数据量 $n$ 线性增长?

根源是经验 score 的谱偏置:低频部分与总体 score 接近、先被学习,高频部分数据集特有、最后被记住。全批量 $B=n$ 实验排除了"样本重复次数"的替代解释——更大 $n$ 重塑损失景观,要求成比例更多的更新才会过拟合。

早停真的能完全避免记忆化吗?

能。在 $\tau \in [\tau_{\mathrm{gen}}, \tau_{\mathrm{mem}}]$ 窗口内停止训练,生成质量已达最优($n=1024$ 时 FID 35.1)且记忆化比例严格为零($f_{\mathrm{mem}}=0\%$);继续训练则 $f_{\mathrm{mem}}$ 在 $\tau_{\mathrm{mem}}$ 处单调上升。

随机特征模型的结论可信吗?

可信。RFNN 的梯度流线性可解,谱定理给出的 $\tau_{\mathrm{gen}}\sim1/\Delta_t$ 与 $\tau_{\mathrm{mem}}\sim\psi_n/\Delta_t$ 预言,与 U-Net 数值实验的 $\tau/n$ 塌缩定量一致;且该模型已在双下降等经典现象中验证过效力。

这个结论对实际训练有什么指导意义?

对数据稀缺领域(物理科学、医学影像等)最直接:早停 + 控制网络容量即可显著降低记忆化风险;Adam 训练同样适用,只是时间尺度更短。

记忆化是否等同于版权与隐私风险?

工业级文生图模型确实被实证证明会复现训练数据(Carlini, USENIX Security 2023;Somepalli, ICCV 2023)。本文给出了规避这一风险的动力学指导:在泛化窗口内早停,使模型生成新颖样本而非复制训练集。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐