引言
你输入"一只穿着宇航服的柴犬在火星上奔跑",AI就真的生成了一张图。你输入"赛博朋克风格的东京雨夜",AI也做到了。这些能力,在过去三年里从实验室走入了每个人的手机。
但你有没有想过一个问题:AI到底是怎么"画"出这些图的?
它不像人类那样从草图开始、一笔一笔地画。它也不像照相机那样"拍"一张照片。AI的"作画"方式,听起来有点像某种魔法——从一堆纯粹的随机噪声中,逐步"显影"出一张清晰的图片。
这个过程,就是扩散模型(Diffusion Models)的核心思想。今天,我们就来聊聊这个让AI学会"无中生有"的神奇技术。
第一章:AI画画的两条老路
在扩散模型出现之前,AI生成图像主要有两条技术路线。
第一条路:GAN(生成对抗网络)。
你可以把GAN想象成两个角色:一个造假币的(生成器),一个验钞的(鉴别器)。造假币的不断伪造,验钞的不断识别真假。这两个角色互相博弈、共同进化,最终造假币的技艺炉火纯青,造出来的"假币"足以以假乱真。
GAN的思路很巧妙,但有个致命问题:不稳定。 两个网络互相博弈,就像两个拳击手对打,谁输了都会崩塌。训练GAN需要非常精细的平衡,稍有不慎,模型就会"崩溃"——生成出来的图千篇一律,全是同一张脸。
第二条路:VAE(变分自编码器)。
思路更简单:把图片"压缩"成一段核心编码(就像把一篇长文压缩成几条要点),再从这个编码"解压缩"还原图片。但问题是,压缩必然会丢失细节。VAE生成的图片总是"模糊的"——像隔着一层毛玻璃看世界,永远不够清晰。
两条路都有各自的短板。直到2020年,一个全新的思路杀了出来。
第二章:一个反直觉的天才想法
扩散模型的想法,用一个词形容就是——反直觉。
传统思维是"教AI怎么画好一张图"。扩散模型却反过来想:先教AI怎么把一张图"毁掉"——然后再教它怎么"还原"。
想象一下这样的场景:你有一张完美的照片,你把它放在复印机上反复复印。第一次复印,还能看清轮廓;第二次,细节开始模糊;第三次,出现噪点…第三十次,已经变成了完全看不出原样的随机噪点。
这个过程,就是"前向扩散"——对一张原始图片,逐步叠加噪声,直到它完全变成纯随机噪声。
而扩散模型要做的,就是学会这个过程的"逆操作"——从纯随机噪声开始,一步步去掉噪声,最终还原出一张清晰的图片。
这听起来有点像什么呢?像雕塑家从一块大理石中"释放"出雕像。 噪声是那块未雕琢的石头,而扩散模型就是那个雕塑家,每一刀去掉一些多余的石头,最终让雕像浮现出来。
第三章:先学会"破坏",再学会"修复"
扩散模型的训练过程,可以分为两个阶段。
第一阶段:破坏(前向扩散)
这一阶段极其简单——给一张原始图片,按照预设的步骤,逐步加入高斯噪声。每一步加的噪声量都是已知的,最终一定会变成纯噪声。
这个过程不需要训练,它只是一个数学公式。但它的作用至关重要:它给AI提供了"先知道答案再做题"的练习机会。
第二阶段:修复(反向去噪)
这才是真正的训练。AI的神经网络需要学会:给定一张加了噪声的图,以及当前噪声的"浓度"(时间步),预测出这张图里原本的噪声是什么,然后把噪声去掉。
就像你看着一张被揉皱的纸,要推测出它原本平整时的样子。
AI在这个阶段会经历大量练习——从"高度噪声→中度噪声→轻度噪声→干净图像"的完整链条中,反复学习去噪。最终,它学会了从任何程度的噪声中,都能推测出"干净图像"应该是什么样子。
一旦学会了去噪,生成就变成了一个简单的过程:从纯随机噪声开始,让它一步步去噪,最终生成一张全新的图片。
这就是为什么扩散模型生成的图片看起来那么"自然"——因为它的训练过程本身就是从"自然"中学习"什么是自然"。
第四章:从实验室到你的手机——Stable Diffusion的秘密
最初的扩散模型(如2020年的DDPM)虽然能生成高质量图片,但有一个巨大的问题:太慢了。
生成一张256×256的图片,需要在像素空间上做上千步去噪,每步都要跑一遍完整的神经网络。这意味着,一张图可能需要几分钟甚至更久才能生成。而且,训练成本极其高昂——一个模型需要几百个GPU连续跑好几天。
2022年,一个关键突破改变了这一切:Stable Diffusion(潜在扩散模型,LDM)。
它的核心洞察非常聪明:大多数像素信息对"理解图片内容"来说都是冗余的。
想象一下,你看到一张"红色苹果"的照片。你真正需要理解的是"苹果"这个语义概念和"红色"这个属性,至于照片中苹果表面的每一颗微小水珠、每一丝纹理——这些细节对"理解"来说并不重要,它们只是"感知层面的噪声"。
Stable Diffusion的做法是:先把图片"压缩"到一个小得多的潜在空间(latent space)中,在这个"压缩版"的空间里进行扩散和去噪,最后再把结果"解压"回高分辨率图片。
这就好比:你要修复一栋楼,不需要对每一块砖头都做精细处理,而是先画一张设计图,在图纸上修改,再按图纸施工。
这个"先压缩再生成"的思路,让计算量降低了5到10倍。原本需要数百个GPU天训练,现在普通显卡也能跑;原本需要几分钟生成的图片,现在几秒钟就能完成。
这也解释了为什么Stable Diffusion能成为开源社区最受欢迎的模型——因为它让每个人都能在自己的电脑上运行AI图像生成。
第五章:扩散模型改变了什么
扩散模型的影响,远远不止"生成好看的图片"这么简单。
第一,它让创意变得"零成本"。 过去,做一张高水平的视觉设计需要专业技能和大量时间。现在,你只需要"描述"——文字就是你的画笔。这不仅是效率的提升,更是创意表达权的民主化。
第二,它开启了"从文本到一切"的时代。 扩散模型的思路被迅速扩展到视频生成(Sora、Video LDM)、3D内容创建(DreamFusion、Point-E)、音乐生成、分子设计,甚至蛋白质结构预测。它的底层逻辑——“从噪声中逐步恢复结构”——被证明是一种极其通用的生成范式,适用于几乎所有类型的"结构数据"。
第三,它正在改变我们对"创造"的理解。 当AI能从随机噪声中"涌现"出清晰的图像,我们不得不重新思考:什么是"创造"?什么是"想象力"?AI的"创造"和我们人类的"创造"有什么本质区别?
当然,扩散模型也有它的局限。它生成的图像可能存在逻辑错误(比如手指数量不对),它需要大量计算资源,它对"微小细节"的把控还不够精准。但每一项局限,都在被后续的研究快速攻克——一致性模型实现了单步生成,ControlNet实现了精确控制,Video LDM实现了高保真视频生成。
尾声:从噪声中看见世界
今天的你,打开手机上的任何一个AI绘画App,输入一句话,等待几秒钟——一张以假乱真的图片就出现在你眼前。
你看到的是"结果",但你没有看到的是:在这几秒钟里,AI经历了一次"从混沌到秩序"的完整旅程。它从100%的纯噪声开始,经过了数十步"去噪→评估→再去噪"的迭代,最终"显现"出了你想要的画面。
这个过程,像极了人类创造的本质——从混沌中寻找秩序,从噪声中提取意义,从不确定中浮现确定。
也许,这就是扩散模型最迷人的地方:它不仅仅是一个技术工具,它还无意中揭示了"创造"本身的一个底层模式——任何创造,本质上都是从"噪声"中"分化"出"结构"的过程。
而AI,只不过把这个过程加速了。
参考文献:
- Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020. 论文链接
- Rombach, R., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022 (Oral). 论文链接
- Dhariwal, P., & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. NeurIPS 2021 (Spotlight). 论文链接
- Song, Y., et al. (2021). Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021 (Best Paper). 论文链接
- Song, Y., et al. (2023). Consistency Models. ICML 2023. 论文链接
- Ho, J., & Salimans, T. (2022). Classifier-Free Diffusion Guidance. NeurIPS 2021 Workshop. 论文链接