1 基本原理

生成对抗网络(GAN)由生成器与判别器两个神经网络构成,二者通过零和博弈进行对抗训练。生成器的目标是学习真实数据的分布,产生逼真的合成样本;判别器的目标是区分真实样本与生成样本。训练过程中,两者交替优化,最终达到动态平衡

1.1 生成器

生成器(Generator)是一个将随机噪声向量(通常来自高斯分布或均匀分布)映射到数据空间的神经网络。其输入为低维隐变量,输出为高维样本(如图像、音频等)。生成器通过参数化分布试图逼近真实数据分布,其性能提升依赖于判别器提供的反馈信号

1.2 判别器

判别器(Discriminator)是一个二分类网络,输入为真实样本或生成样本,输出为样本来自真实分布的概率。判别器通过最大化分类准确率来优化自身参数,区分真假样本的能力越强,对生成器的压力越大。

1.3 对抗训练过程

对抗训练通过交替更新生成器和判别器实现。每次迭代中,判别器基于真实样本和当前生成样本更新,生成器则根据判别器的输出调整参数,以降低判别器的区分能力。

1.3.1 价值函数

GAN的对抗目标由价值函数(Value Function)定义。原始GAN采用极小极大博弈形式: \[ \min_G \max_D V(D,G) = \mathbb{E}_{x \sim p_{\text{data}}} [\log D(x)] + \mathbb{E}_{z \sim p_z} [\log(1 - D(G(z)))] \] 其中,判别器最大化该值,生成器最小化该值。

1.3.2 纳什均衡

理想训练状态下,GAN达到纳什均衡:生成器完全捕捉真实分布,判别器无法区分真假,输出概率恒为0.5。此时价值函数不再变化,但实际训练中通常难以严格实现。

2 主要架构

2.1 原始GAN

伊恩·古德费洛等人于2014年提出的初始版本,使用全连接层构建生成器和判别器,训练不稳定且易出现模式崩溃。价值函数基于交叉熵,生成器梯度在判别器过强时易消失。

2.2 深度卷积GAN(DCGAN)

DCGAN将卷积神经网络引入GAN,用转置卷积进行上采样,采用批归一化Leaky ReLU激活函数Adam优化器,显著提升了图像生成稳定性和质量,成为后续许多架构的基础。

2.3 沃瑟斯坦GAN(WGAN)

WGAN使用沃瑟斯坦距离(Earth Mover's Distance)替代JS散度,通过裁剪判别器权重(后改为梯度惩罚)保证Lipschitz连续性,有效缓解了梯度消失和模式崩溃问题,训练更为稳定。

2.4 条件GAN(CGAN)

条件GAN在生成器和判别器中均加入额外条件信息(如类别标签、文本描述),使生成过程可控。判别器需要同时判断样本真假及是否符合条件,从而生成指定类别的样本。

2.5 循环一致性GAN(CycleGAN)

CycleGAN用于无配对数据的图像到图像转换,引入循环一致性损失(Cycle Consistency Loss)——将源域图像转换为目标域后再转换回源域应保持原样。该架构在风格迁移、季节变换等任务中表现优异。

3 训练挑战与优化

3.1 模式崩溃(Mode Collapse)

模式崩溃指生成器只产生少数几种或单一类型的样本,无法覆盖真实数据的全部模式。原因在于生成器发现欺骗判别器的捷径,放弃了多样性。常用对策包括引入多样损失、使用多个生成器或小批量判别。

3.2 不收敛问题

GAN的对抗训练本质是一个鞍点寻找过程,优化轨迹可能振荡或发散。不收敛表现为损失值剧烈波动或生成质量持续无改善。改进方法包括调整学习率、使用梯度惩罚和正则化技术。

3.3 梯度消失与梯度爆炸

当判别器过于强大时,生成器梯度趋近于零,更新停滞。反之,判别器过弱则梯度爆炸。WGAN的沃瑟斯坦距离和谱归一化等技术可缓解此问题。

3.4 稳定性改进方法

3.4.1 标签平滑

将判别器的真实标签由1替换为0.9等小于1的值,伪造标签由0替换为0.1,防止判别器过度自信,减少梯度消失。

3.4.2 谱归一化

对判别器每层权重矩阵施加谱归一化,约束其最大奇异值,保证Lipschitz连续性,提升训练稳定性,在SNGAN中得到广泛应用。

3.4.3 梯度惩罚

WGAN-GP在判别器损失中加入对输入梯度范数的惩罚项,迫使判别器满足1-Lipschitz条件,避免了权重裁剪导致的质量下降。

4 应用领域

4.1 图像生成与编辑

4.1.1 人脸生成

StyleGAN系列可生成具有可控属性(年龄、姿态、表情)的高分辨率逼真人脸,广泛应用于虚拟形象创作和面部数据集扩充。

4.1.2 图像超分辨率

SRGAN通过对抗训练提升低分辨率图像细节,生成的高分辨率图像在感知质量上优于传统方法,但可能引入伪影。

4.2 数据增强与合成

GAN生成合成样本用于扩充训练数据集,尤其在医学影像、自动驾驶等标注稀缺的领域,有效缓解过拟合,提升模型泛化能力。

4.3 风格迁移

CycleGAN、CartoonGAN等实现图像风格转换(如照片变油画、白天变黑夜),无需成对训练数据,在艺术创作和影像处理中广泛使用。

4.4 文本到图像生成

StackGAN、AttnGAN等根据文本描述生成对应图像,先合成低分辨率草图,再逐步细化细节,在条件生成任务中取得显著进展。

4.5 视频处理与预测

VideoGAN、MoCoGAN等将GAN扩展至视频域,用于生成连续帧、视频预测和未来帧预测,可应用于动画制作和自动驾驶场景推演。

5 评价指标

5.1 Inception Score(IS)

IS基于Inception网络,通过评估生成图像的类别清晰度和多样性来打分。高分要求图像内容明确且类别分布均匀,但无法检测数据集内部相似性,且对分布先验依赖较强。

5.2 Fréchet Inception Distance(FID)

FID计算真实图像与生成图像在Inception网络特征空间中的Fréchet距离。数值越小表示生成分布与真实分布越接近,更符合人类感知,成为主流评价指标。

5.3 感知相似度指标

包括LPIPS(Learned Perceptual Image Patch Similarity)等,利用预训练网络的特征差异度量图像对之间的感知距离,常用于评估图像修复、超分辨率等任务的质量。

6 未来方向与伦理考量

6.1 与自监督学习结合

将GAN与对比学习、掩码自编码器等自监督方法结合,提升生成器对数据内在结构的学习能力,有望在少样本和跨模态生成中取得突破。

6.2 可控生成

通过隐空间解耦、条件注入或文本引导,实现细粒度属性编辑与组合生成。未来方向包括精细语义操控和与大型语言模型的协同。

6.3 深度伪造(Deepfake)的防范

GAN生成的高保真假脸、假音频带来了隐私、安全和法律风险。研究重点包括开发检测算法(如基于眨眼、心率等生物特征)、加入数字水印、推动立法与教育,以平衡技术创新与社会责任。