🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
📜
潜在空间的降维打击Stable Diffusion的核心创新是"潜在扩散"(Latent Diffusion):不在像素空间(512×512×3≈78万个值)做扩散,而是在VAE压缩后的潜在空间(64×64×4≈1.6万个值)中做。这把计算量减少了约48倍,让扩散模型第一次能在消费级显卡上运行。2022年8月,Stability AI开源了Stable Diffusion,这是AI历史上最重要的开源时刻之一——一夜之间,任何人都能在自己的电脑上生成高质量图像。开源后的一个月内,社区就涌现出数千个微调模型、LoRA和控制插件,形成了庞大的生成式AI生态。
来源:Rombach et al., "High-Resolution Image Synthesis with Latent Diffusion Models", CVPR 2022
一句话总结
💡
Stable Diffusion 在 VAE 的潜空间而非像素空间执行扩散,配合 U-Net 和 CLIP 文本条件实现高效高质量文生图。
常见误区
这些坑别踩
✗
误区 1
Stable Diffusion 直接在像素空间扩散。
✓
正确理解
它在压缩的潜空间扩散以大幅降低计算量,最后由 VAE 解码回像素。
✗
误区 2
CLIP 生成文本。
✓
正确理解
CLIP 提供文本编码作为条件,引导 U-Net 去噪方向,它本身不生成图像。
✗
误区 3
更大 CFG Scale 一定更好。
✓
正确理解
CFG 过大会导致色彩过饱和和伪影,需在符合提示和图像质量间权衡。