<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI生成 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E7%94%9F%E6%88%90/</link>
		<description>Recent content in AI生成 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Fri, 14 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E7%94%9F%E6%88%90/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>从噪声中诞生——扩散模型如何让AI学会&#39;无中生有&#39;</title>
				<link>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</link>
				<pubDate>Fri, 14 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-diffusion-models-create-images-from-noise/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你输入&amp;quot;一只穿着宇航服的柴犬在火星上奔跑&amp;quot;，AI就真的生成了一张图。你输入&amp;quot;赛博朋克风格的东京雨夜&amp;quot;，AI也做到了。这些能力，在过去三年里从实验室走入了每个人的手机。&lt;/p&gt;&#xA;&lt;p&gt;但你有没有想过一个问题：&lt;strong&gt;AI到底是怎么&amp;quot;画&amp;quot;出这些图的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它不像人类那样从草图开始、一笔一笔地画。它也不像照相机那样&amp;quot;拍&amp;quot;一张照片。AI的&amp;quot;作画&amp;quot;方式，听起来有点像某种魔法——&lt;strong&gt;从一堆纯粹的随机噪声中，逐步&amp;quot;显影&amp;quot;出一张清晰的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是扩散模型（Diffusion Models）的核心思想。今天，我们就来聊聊这个让AI学会&amp;quot;无中生有&amp;quot;的神奇技术。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai画画的两条老路&#34;&gt;第一章：AI画画的两条老路&lt;/h2&gt;&#xA;&lt;p&gt;在扩散模型出现之前，AI生成图像主要有两条技术路线。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一条路：GAN（生成对抗网络）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可以把GAN想象成两个角色：一个造假币的（生成器），一个验钞的（鉴别器）。造假币的不断伪造，验钞的不断识别真假。这两个角色互相博弈、共同进化，最终造假币的技艺炉火纯青，造出来的&amp;quot;假币&amp;quot;足以以假乱真。&lt;/p&gt;&#xA;&lt;p&gt;GAN的思路很巧妙，但有个致命问题：&lt;strong&gt;不稳定。&lt;/strong&gt; 两个网络互相博弈，就像两个拳击手对打，谁输了都会崩塌。训练GAN需要非常精细的平衡，稍有不慎，模型就会&amp;quot;崩溃&amp;quot;——生成出来的图千篇一律，全是同一张脸。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二条路：VAE（变分自编码器）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;思路更简单：把图片&amp;quot;压缩&amp;quot;成一段核心编码（就像把一篇长文压缩成几条要点），再从这个编码&amp;quot;解压缩&amp;quot;还原图片。但问题是，压缩必然会丢失细节。VAE生成的图片总是&amp;quot;模糊的&amp;quot;——像隔着一层毛玻璃看世界，永远不够清晰。&lt;/p&gt;&#xA;&lt;p&gt;两条路都有各自的短板。直到2020年，一个全新的思路杀了出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章一个反直觉的天才想法&#34;&gt;第二章：一个反直觉的天才想法&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的想法，用一个词形容就是——&lt;strong&gt;反直觉&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统思维是&amp;quot;教AI怎么画好一张图&amp;quot;。扩散模型却反过来想：&lt;strong&gt;先教AI怎么把一张图&amp;quot;毁掉&amp;quot;——然后再教它怎么&amp;quot;还原&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下这样的场景：你有一张完美的照片，你把它放在复印机上反复复印。第一次复印，还能看清轮廓；第二次，细节开始模糊；第三次，出现噪点&amp;hellip;第三十次，已经变成了完全看不出原样的随机噪点。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，就是&amp;quot;前向扩散&amp;quot;——&lt;strong&gt;对一张原始图片，逐步叠加噪声，直到它完全变成纯随机噪声。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而扩散模型要做的，就是&lt;strong&gt;学会这个过程的&amp;quot;逆操作&amp;quot;&lt;/strong&gt;——从纯随机噪声开始，一步步去掉噪声，最终还原出一张清晰的图片。&lt;/p&gt;&#xA;&lt;p&gt;这听起来有点像什么呢？&lt;strong&gt;像雕塑家从一块大理石中&amp;quot;释放&amp;quot;出雕像。&lt;/strong&gt; 噪声是那块未雕琢的石头，而扩散模型就是那个雕塑家，每一刀去掉一些多余的石头，最终让雕像浮现出来。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章先学会破坏再学会修复&#34;&gt;第三章：先学会&amp;quot;破坏&amp;quot;，再学会&amp;quot;修复&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的训练过程，可以分为两个阶段。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一阶段：破坏（前向扩散）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一阶段极其简单——给一张原始图片，按照预设的步骤，逐步加入高斯噪声。每一步加的噪声量都是已知的，最终一定会变成纯噪声。&lt;/p&gt;&#xA;&lt;p&gt;这个过程不需要训练，它只是一个数学公式。&lt;strong&gt;但它的作用至关重要：它给AI提供了&amp;quot;先知道答案再做题&amp;quot;的练习机会。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二阶段：修复（反向去噪）&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这才是真正的训练。AI的神经网络需要学会：&lt;strong&gt;给定一张加了噪声的图，以及当前噪声的&amp;quot;浓度&amp;quot;（时间步），预测出这张图里原本的噪声是什么，然后把噪声去掉。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你看着一张被揉皱的纸，要推测出它原本平整时的样子。&lt;/p&gt;&#xA;&lt;p&gt;AI在这个阶段会经历大量练习——从&amp;quot;高度噪声→中度噪声→轻度噪声→干净图像&amp;quot;的完整链条中，反复学习去噪。最终，它学会了从任何程度的噪声中，都能推测出&amp;quot;干净图像&amp;quot;应该是什么样子。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一旦学会了去噪，生成就变成了一个简单的过程：从纯随机噪声开始，让它一步步去噪，最终生成一张全新的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么扩散模型生成的图片看起来那么&amp;quot;自然&amp;quot;——因为它的训练过程本身就是从&amp;quot;自然&amp;quot;中学习&amp;quot;什么是自然&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从实验室到你的手机stable-diffusion的秘密&#34;&gt;第四章：从实验室到你的手机——Stable Diffusion的秘密&lt;/h2&gt;&#xA;&lt;p&gt;最初的扩散模型（如2020年的DDPM）虽然能生成高质量图片，但有一个巨大的问题：&lt;strong&gt;太慢了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;生成一张256×256的图片，需要在像素空间上做上千步去噪，每步都要跑一遍完整的神经网络。这意味着，一张图可能需要几分钟甚至更久才能生成。而且，训练成本极其高昂——一个模型需要几百个GPU连续跑好几天。&lt;/p&gt;&#xA;&lt;p&gt;2022年，一个关键突破改变了这一切：&lt;strong&gt;Stable Diffusion（潜在扩散模型，LDM）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它的核心洞察非常聪明：&lt;strong&gt;大多数像素信息对&amp;quot;理解图片内容&amp;quot;来说都是冗余的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你看到一张&amp;quot;红色苹果&amp;quot;的照片。你真正需要理解的是&amp;quot;苹果&amp;quot;这个语义概念和&amp;quot;红色&amp;quot;这个属性，至于照片中苹果表面的每一颗微小水珠、每一丝纹理——这些细节对&amp;quot;理解&amp;quot;来说并不重要，它们只是&amp;quot;感知层面的噪声&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;Stable Diffusion的做法是：&lt;strong&gt;先把图片&amp;quot;压缩&amp;quot;到一个小得多的潜在空间（latent space）中，在这个&amp;quot;压缩版&amp;quot;的空间里进行扩散和去噪，最后再把结果&amp;quot;解压&amp;quot;回高分辨率图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就好比：你要修复一栋楼，不需要对每一块砖头都做精细处理，而是先画一张设计图，在图纸上修改，再按图纸施工。&lt;/p&gt;&#xA;&lt;p&gt;这个&amp;quot;先压缩再生成&amp;quot;的思路，让计算量降低了&lt;strong&gt;5到10倍&lt;/strong&gt;。原本需要数百个GPU天训练，现在普通显卡也能跑；原本需要几分钟生成的图片，现在几秒钟就能完成。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这也解释了为什么Stable Diffusion能成为开源社区最受欢迎的模型——因为它让每个人都能在自己的电脑上运行AI图像生成。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章扩散模型改变了什么&#34;&gt;第五章：扩散模型改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;扩散模型的影响，远远不止&amp;quot;生成好看的图片&amp;quot;这么简单。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它让创意变得&amp;quot;零成本&amp;quot;。&lt;/strong&gt; 过去，做一张高水平的视觉设计需要专业技能和大量时间。现在，你只需要&amp;quot;描述&amp;quot;——文字就是你的画笔。这不仅是效率的提升，更是创意表达权的民主化。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;从文本到一切&amp;quot;的时代。&lt;/strong&gt; 扩散模型的思路被迅速扩展到视频生成（Sora、Video LDM）、3D内容创建（DreamFusion、Point-E）、音乐生成、分子设计，甚至蛋白质结构预测。它的底层逻辑——&amp;ldquo;从噪声中逐步恢复结构&amp;rdquo;——被证明是一种极其通用的生成范式，适用于几乎所有类型的&amp;quot;结构数据&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它正在改变我们对&amp;quot;创造&amp;quot;的理解。&lt;/strong&gt; 当AI能从随机噪声中&amp;quot;涌现&amp;quot;出清晰的图像，我们不得不重新思考：什么是&amp;quot;创造&amp;quot;？什么是&amp;quot;想象力&amp;quot;？AI的&amp;quot;创造&amp;quot;和我们人类的&amp;quot;创造&amp;quot;有什么本质区别？&lt;/p&gt;&#xA;&lt;p&gt;当然，扩散模型也有它的局限。它生成的图像可能存在逻辑错误（比如手指数量不对），它需要大量计算资源，它对&amp;quot;微小细节&amp;quot;的把控还不够精准。但每一项局限，都在被后续的研究快速攻克——一致性模型实现了单步生成，ControlNet实现了精确控制，Video LDM实现了高保真视频生成。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声从噪声中看见世界&#34;&gt;尾声：从噪声中看见世界&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机上的任何一个AI绘画App，输入一句话，等待几秒钟——一张以假乱真的图片就出现在你眼前。&lt;/p&gt;&#xA;&lt;p&gt;你看到的是&amp;quot;结果&amp;quot;，但你没有看到的是：在这几秒钟里，AI经历了一次&amp;quot;从混沌到秩序&amp;quot;的完整旅程。它从100%的纯噪声开始，经过了数十步&amp;quot;去噪→评估→再去噪&amp;quot;的迭代，最终&amp;quot;显现&amp;quot;出了你想要的画面。&lt;/p&gt;&#xA;&lt;p&gt;这个过程，像极了人类创造的本质——&lt;strong&gt;从混沌中寻找秩序，从噪声中提取意义，从不确定中浮现确定。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;也许，这就是扩散模型最迷人的地方：它不仅仅是一个技术工具，它还无意中揭示了&amp;quot;创造&amp;quot;本身的一个底层模式——&lt;strong&gt;任何创造，本质上都是从&amp;quot;噪声&amp;quot;中&amp;quot;分化&amp;quot;出&amp;quot;结构&amp;quot;的过程。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而AI，只不过把这个过程加速了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2006.11239&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rombach, R., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. &lt;em&gt;CVPR 2022 (Oral)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2112.10752&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Dhariwal, P., &amp;amp; Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. &lt;em&gt;NeurIPS 2021 (Spotlight)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2105.05233&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2021). Score-Based Generative Modeling through Stochastic Differential Equations. &lt;em&gt;ICLR 2021 (Best Paper)&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2011.13456&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Song, Y., et al. (2023). Consistency Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.01469&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ho, J., &amp;amp; Salimans, T. (2022). Classifier-Free Diffusion Guidance. &lt;em&gt;NeurIPS 2021 Workshop&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2207.12598&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
