扩散模型原理
扩散模型通过逐步加噪和去噪过程生成数据,是当前主流的生成模型之一。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
扩散模型的灵感来自非平衡热力学。前向过程逐步加噪直到变成纯噪声,反向过程学习逐步去噪。这个看似"绕远路"的方法却生成了前所未有的高质量图像,最终催生了Stable Diffusion和Midjourney。
来源:Ho et al., "Denoising Diffusion Probabilistic Models", 2020
原始扩散模型(DDPM)需要1000步去噪才能生成一张图片,每一步都是一次完整的神经网络前向传播,生成一张图可能需要几分钟。DDIM(Denoising Diffusion Implicit Models)的突破性贡献是:它证明了扩散过程不一定要遵循马尔可夫链,可以在保持生成质量的同时把采样步数从1000降到50甚至更少。后来的DPM-Solver和一致性模型进一步将采样压缩到1-4步。另一个关键技术是"无分类器引导"(Classifier-Free Guidance):同时训练条件和无条件模型,推理时用两者的差值来引导生成——guidance scale越大,图像越精致但多样性越低。
来源:Song et al., "Denoising Diffusion Implicit Models", ICLR 2021
DDPM 通过前向过程逐步加噪将数据变为纯噪声,再训练网络学习反向去噪过程,逐步从噪声恢复出数据。
这些坑别踩
误区 1
扩散模型和 VAE 完全不同。
正确理解
DDPM 可看作分层 VAE 的特例,两者都基于变分推断,DDPM 用大步数逼近。
误区 2
反向去噪一步就能完成。
正确理解
标准 DDPM 需数百上千步逐步去噪,这是其采样慢的原因,加速采样是研究热点。
误区 3
模型直接预测最终图像。
正确理解
DDPM 通常预测每一步的噪声,通过减噪逐步逼近数据。