引言:你看到的是"生成",但AI做的是"消除"

2022年,Stable Diffusion开源后,全世界都疯了——你输入一句话,AI就能生成一张画。有人用它做设计,有人用它生成表情包,甚至有人用它"修复"老照片。

但你有没有想过:AI到底是怎么"画"出这些图的?

你可能以为,AI像人类画家一样,先构思,再打草稿,再上色,最后修饰。但事实远比这更反直觉——AI不是"画"出来的,而是"消去"出来的。

它做的不是"从无到有",而是"从有到精"。


一、两种"画家"的思路

在AI图像生成领域,主要有两种"画画"的方式。

第一种叫GAN(生成对抗网络),2014年由Ian Goodfellow提出。 它的思路是让两个网络互相博弈:一个负责"画"(生成器),一个负责"挑刺"(判别器)。生成器努力画出以假乱真的图像,判别器努力分辨真假。两者互相竞争,最终生成器画出的图连判别器都分不清真假了。

这个思路很聪明,但它有一个致命问题:训练极其不稳定。 就像两个拳击手对打,一个太强另一个就崩了。生成器和判别者一旦失衡,生成器就会陷入"模式崩溃"——永远只画同一张图。

第二种叫扩散模型(Diffusion Model),2020年由Ho等人提出。 它的思路完全不同——不是"画",而是"去噪"。

想象一下,你有一张清晰的图片,然后你一点点往上面加噪点,直到它完全变成一团随机噪声。这个过程叫"正向扩散"。

扩散模型做的事,就是学会逆转这个过程——从一团随机噪声开始,一步步去除噪声,直到恢复出清晰的图像。

它不是在"画",而是在"雕塑"。 就像米开朗基罗说的:“大卫本来就在大理石里,我只是把不属于它的部分去掉。“扩散模型去掉的,就是噪声。


二、一个简单到令人惊讶的原理

让我们用更具体的方式理解扩散模型在做什么。

第一步:正向过程——“毁掉"一张图。 训练时,AI拿一张真实的图片(比如一张猫的照片),然后不断地往上加噪声。每一步加一点,直到图像完全变成随机噪声。经过几百步后,你再也看不出原来有只猫了。

第二步:反向过程——“修复"一张图。 AI学习的是"逆向操作”——它知道当前这张图有多"脏”,然后预测"刚才加进去的噪声是什么样子的”,接着减去它。每减去一步,图像就清晰一点。反复做几百步,最终从一团纯噪声中"浮现"出一张清晰的猫图。

关键洞察: 扩散模型不是在"学习怎么画猫”,而是在学习"噪声长什么样"。它学会的是"什么样的噪声不是猫身上的噪声"——换言之,它学会了"猫长什么样"的反面。

这听起来很绕,但它的数学本质非常优雅:AI学习的是数据分布(猫的图片)的梯度方向,然后从随机噪声出发,沿着这个梯度方向一步步"走"到猫的图片。

就像你站在山顶上,闭着眼睛,只靠感受坡度,一步步走下山——最终你一定能走到山脚。扩散模型从随机噪声出发,一步步"下坡",最终走到清晰的图像。


三、为什么你需要"潜空间"?

DDPM(2020年)在理论上很漂亮,但它有一个实际痛点:太慢了。

在像素空间做去噪,意味着模型要处理512×512×3=78万个像素值。每一步去噪都需要计算这么多数据,而且DDPM需要1000步才能生成一张可用的图。一张图生成完,够你喝两杯咖啡了。

2022年,Stable Diffusion的团队提出了一个天才的解决方案:别在像素空间做,去"潜空间"做。

什么是"潜空间"?把它想象成图像的精简版速记表

一张512×512的图有78万个像素,但其中大部分信息是冗余的——比如"蓝天"的蓝色,有几千个像素值几乎一样。这些信息不需要逐个处理,只要知道"这里是蓝色"就够了。

Stable Diffusion用了一个预训练的自编码器,把一张图像压缩到64×64×4的"潜表示"——只有约1.6万个数值,是原来的1/48。 而且这个压缩是"有损但聪明"的——它保留了语义信息(“有一只猫,在草地上”),去掉了感知冗余(“猫的每根毛的颜色细微差别”)。

然后,扩散过程在这个压缩后的潜空间里进行。计算量直接降到了原来的1/48。 这就是为什么Stable Diffusion可以在消费级显卡上运行,而DALL-E 2需要云端服务器。

但代价是什么? 潜空间压缩丢失了细节。这就是为什么Stable Diffusion生成的图在细节上有时不如DALL-E 2——它在压缩时"丢掉"的那些信息,再也回不来了。


四、AI真的"理解"它画的是什么吗?

到这里,我们不得不面对一个更根本的问题:AI在"去噪"的过程中,真的"理解"它画的是什么吗?

答案可能会让你失望:很可能不。

AI在去噪的过程中,没有"猫"的概念,没有"草地"的概念,没有"蓝天"的概念。它只知道"这个像素的噪声模式,在训练数据中,和这种特定形状常常一起出现"。

它学到的,是一个巨大的统计关联网络——“这种形状的噪声模式,通常意味着这里有猫耳朵”。但它不知道"猫"是什么,不知道猫会喵喵叫,不知道猫有九条命(至少在传说中)。

它知道的是"猫的统计模式",而不是"猫"本身。

这不是AI的缺陷,而是它的本质。AI的"理解"和我们人类的"理解"是两种完全不同的东西。人类的"理解"有身体经验、有情感、有文化背景——你知道猫摸起来是什么感觉,你知道猫会蹭你的腿,你知道猫不是"一堆像素的统计模式"。

AI的"理解"是纯粹的统计模式识别——它知道"猫的像素分布"和"狗的像素分布"的区别,但它不知道"猫是宠物"这件事。

但这不妨碍它生成让你惊叹的图像。

就像你不需要懂空气动力学也能开飞机,AI不需要"理解"猫也能画猫。它只需要知道猫的"统计分布"就够了。


结语:从"对抗"到"去噪"

回看AI图像生成的发展史,有一条清晰的线索:从GAN的"对抗"范式,到扩散模型的"去噪"范式。

对抗范式假设智能需要"竞争"——两个网络互相博弈,从中涌现出创造力。这个思路性感,但不稳定。

去噪范式假设智能需要"消除"——从混乱中逐步恢复秩序,从噪声中浮现出结构。这个思路朴实,但稳定。

而扩散模型之所以成为主流,恰恰是因为它承认了AI的局限性。它不试图"创造"新东西,而是从一个充满可能性的起点(随机噪声)出发,按照训练数据中学到的统计模式,一步步"走到"一个合理的终点。

创造力不是"凭空产生",而是"从混乱中浮现秩序"。 这不仅是AI的"画画"方式,也可能是人类创造力的本质——我们的大脑,也不过是在无数可能的"噪声"中,找到那个最"合理"的答案。


参考资料

  • Goodfellow, I. J., et al. (2014). “Generative Adversarial Nets.” NeurIPS 2014. https://arxiv.org/abs/1406.2661
  • Ho, J., Jain, A., & Abbeel, P. (2020). “Denoising Diffusion Probabilistic Models.” NeurIPS 2020. https://arxiv.org/abs/2006.11239
  • Rombach, R., et al. (2022). “High-Resolution Image Synthesis with Latent Diffusion Models.” CVPR 2022. https://arxiv.org/abs/2112.10752
  • 本文核心论证素材来源于论文论证卡库生成模型领域:GAN论证卡、DDPM论证卡、Stable Diffusion论证卡,经Ω-CFI审查框架校验。