知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
潜在空间的降维打击

Stable Diffusion的核心创新是"潜在扩散"(Latent Diffusion):不在像素空间(512×512×3≈78万个值)做扩散,而是在VAE压缩后的潜在空间(64×64×4≈1.6万个值)中做。这把计算量减少了约48倍,让扩散模型第一次能在消费级显卡上运行。2022年8月,Stability AI开源了Stable Diffusion,这是AI历史上最重要的开源时刻之一——一夜之间,任何人都能在自己的电脑上生成高质量图像。开源后的一个月内,社区就涌现出数千个微调模型、LoRA和控制插件,形成了庞大的生成式AI生态。

来源:Rombach et al., "High-Resolution Image Synthesis with Latent Diffusion Models", CVPR 2022

一句话总结
💡

Stable Diffusion 在 VAE 的潜空间而非像素空间执行扩散,配合 U-Net 和 CLIP 文本条件实现高效高质量文生图。

常见误区

这些坑别踩

✗

误区 1

Stable Diffusion 直接在像素空间扩散。

✓

正确理解

它在压缩的潜空间扩散以大幅降低计算量,最后由 VAE 解码回像素。

✗

误区 2

CLIP 生成文本。

✓

正确理解

CLIP 提供文本编码作为条件,引导 U-Net 去噪方向,它本身不生成图像。

✗

误区 3

更大 CFG Scale 一定更好。

✓

正确理解

CFG 过大会导致色彩过饱和和伪影,需在符合提示和图像质量间权衡。