知了AI学习平台Logo知了
知识图谱

扩散模型原理

扩散模型通过逐步加噪和去噪过程生成数据,是当前主流的生成模型之一。

加噪去噪添加使用经典方法理论基础预测扩散模型前向过程反向过程噪声U-NetDDPM分数匹配
核心
概念
方法
应用
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

扩散模型的灵感来自非平衡热力学。前向过程逐步加噪直到变成纯噪声,反向过程学习逐步去噪。这个看似"绕远路"的方法却生成了前所未有的高质量图像,最终催生了Stable Diffusion和Midjourney。

来源:Ho et al., "Denoising Diffusion Probabilistic Models", 2020

😲
从一千步到五十步的加速

原始扩散模型(DDPM)需要1000步去噪才能生成一张图片,每一步都是一次完整的神经网络前向传播,生成一张图可能需要几分钟。DDIM(Denoising Diffusion Implicit Models)的突破性贡献是:它证明了扩散过程不一定要遵循马尔可夫链,可以在保持生成质量的同时把采样步数从1000降到50甚至更少。后来的DPM-Solver和一致性模型进一步将采样压缩到1-4步。另一个关键技术是"无分类器引导"(Classifier-Free Guidance):同时训练条件和无条件模型,推理时用两者的差值来引导生成——guidance scale越大,图像越精致但多样性越低。

来源:Song et al., "Denoising Diffusion Implicit Models", ICLR 2021

一句话总结
💡

DDPM 通过前向过程逐步加噪将数据变为纯噪声,再训练网络学习反向去噪过程,逐步从噪声恢复出数据。

常见误区

这些坑别踩

✗

误区 1

扩散模型和 VAE 完全不同。

✓

正确理解

DDPM 可看作分层 VAE 的特例,两者都基于变分推断,DDPM 用大步数逼近。

✗

误区 2

反向去噪一步就能完成。

✓

正确理解

标准 DDPM 需数百上千步逐步去噪,这是其采样慢的原因,加速采样是研究热点。

✗

误区 3

模型直接预测最终图像。

✓

正确理解

DDPM 通常预测每一步的噪声,通过减噪逐步逼近数据。