GAN 训练博弈动画
展示生成对抗网络中生成器与判别器的对抗训练过程,双方在博弈中共同进化。
Generative Adversarial Network (GAN)
GAN 由两个网络组成:生成器 G(试图造假)和判别器 D(试图辨真伪),二者构成对抗博弈。
生成模型对比:VAE vs GAN vs Diffusion
三种主流生成模型在生成质量、训练稳定性和多样性方面的对比。
| 对比项 | VAE | GAN | Diffusion |
|---|---|---|---|
| 生成原理 | 编码-解码+变分推断 | 生成器-判别器对抗 | 逐步去噪 |
| 生成质量 | 中等(偏模糊) | 高(锐利) | 最高⭐ |
| 训练稳定性 | 稳定 | 不稳定(模式崩溃) | 稳定⭐ |
| 生成速度 | 快⭐ | 快 | 慢(多步去噪) |
| 样本多样性 | 高 | 较低(模式崩溃) | 高⭐ |
| 似然估计 | 有(下界) | 无 | 有 |
| 理论框架 | 变分推断 | 博弈论 | 随机微分方程 |
| 代表应用 | 数据压缩/异常检测 | 人脸/图像生成 | Stable Diffusion/DALL-E⭐ |
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
GAN的训练是一场生成器和判别器的"猫鼠游戏",但二者很容易失衡。最常见的失败模式是"模式崩溃"——生成器发现骗过判别器的一个套路后反复使用,只会生成同一种样本。这就是为什么GAN曾被称为"最难训练的模型"。
StyleGAN由NVIDIA于2019年提出,引入了"风格注入"机制——在不同的网络层注入不同的风格向量,分别控制粗粒度(姿势、脸型)和细粒度(发色、肤色)特征。网站thispersondoesnotexist.com每次刷新都生成一张不存在的人脸,用的就是StyleGAN。CycleGAN则解决了一个更难的问题:无配对的图像翻译——没有"马"和"斑马"的配对图片,却能把马变成斑马。它用"循环一致性损失"约束翻译:马→斑马→马应该恢复原图。这些变体展示了GAN架构创新的丰富想象力。
来源:Karras et al., "A Style-Based Generator Architecture for GANs", CVPR 2019
GAN 通过生成器与判别器的博弈训练,生成器试图骗过判别器而判别器试图区分真假,最终生成器学会逼近真实分布。
这些坑别踩
误区 1
GAN 能计算生成样本的似然。
正确理解
GAN 是隐式密度模型,不显式建模概率分布,无法直接计算似然。
误区 2
判别器越好生成器越好。
正确理解
两者需均衡,判别器过强会使生成器梯度消失,需保持对抗平衡。
误区 3
GAN 训练很稳定。
正确理解
GAN 易出现模式坍缩和振荡,是出了名的难训,需多种技巧稳定。