<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>生成模型 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E7%94%9F%E6%88%90%E6%A8%A1%E5%9E%8B/</link>
		<description>Recent content in 生成模型 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sun, 02 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E7%94%9F%E6%88%90%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI画家是怎么「无中生有」的？——从一团噪声到一幅画的奇妙旅程</title>
				<link>https://lingyu7.com/posts/from-noise-to-masterpiece-diffusion-models/</link>
				<pubDate>Sun, 02 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/from-noise-to-masterpiece-diffusion-models/</guid>
				<description>&lt;h2 id=&#34;引言你看到的是生成但ai做的是消除&#34;&gt;引言：你看到的是&amp;quot;生成&amp;quot;，但AI做的是&amp;quot;消除&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2022年，Stable Diffusion开源后，全世界都疯了——你输入一句话，AI就能生成一张画。有人用它做设计，有人用它生成表情包，甚至有人用它&amp;quot;修复&amp;quot;老照片。&lt;/p&gt;&#xA;&lt;p&gt;但你有没有想过：&lt;strong&gt;AI到底是怎么&amp;quot;画&amp;quot;出这些图的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能以为，AI像人类画家一样，先构思，再打草稿，再上色，最后修饰。但事实远比这更反直觉——&lt;strong&gt;AI不是&amp;quot;画&amp;quot;出来的，而是&amp;quot;消去&amp;quot;出来的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;它做的不是&amp;quot;从无到有&amp;quot;，而是&amp;quot;从有到精&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一两种画家的思路&#34;&gt;一、两种&amp;quot;画家&amp;quot;的思路&lt;/h2&gt;&#xA;&lt;p&gt;在AI图像生成领域，主要有两种&amp;quot;画画&amp;quot;的方式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一种叫GAN（生成对抗网络），2014年由Ian Goodfellow提出。&lt;/strong&gt; 它的思路是让两个网络互相博弈：一个负责&amp;quot;画&amp;quot;（生成器），一个负责&amp;quot;挑刺&amp;quot;（判别器）。生成器努力画出以假乱真的图像，判别器努力分辨真假。两者互相竞争，最终生成器画出的图连判别器都分不清真假了。&lt;/p&gt;&#xA;&lt;p&gt;这个思路很聪明，但它有一个致命问题：&lt;strong&gt;训练极其不稳定。&lt;/strong&gt; 就像两个拳击手对打，一个太强另一个就崩了。生成器和判别者一旦失衡，生成器就会陷入&amp;quot;模式崩溃&amp;quot;——永远只画同一张图。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二种叫扩散模型（Diffusion Model），2020年由Ho等人提出。&lt;/strong&gt; 它的思路完全不同——不是&amp;quot;画&amp;quot;，而是&amp;quot;去噪&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你有一张清晰的图片，然后你一点点往上面加噪点，直到它完全变成一团随机噪声。这个过程叫&amp;quot;正向扩散&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;扩散模型做的事，就是&lt;strong&gt;学会逆转这个过程&lt;/strong&gt;——从一团随机噪声开始，一步步去除噪声，直到恢复出清晰的图像。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它不是在&amp;quot;画&amp;quot;，而是在&amp;quot;雕塑&amp;quot;。&lt;/strong&gt; 就像米开朗基罗说的：&amp;ldquo;大卫本来就在大理石里，我只是把不属于它的部分去掉。&amp;ldquo;扩散模型去掉的，就是噪声。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二一个简单到令人惊讶的原理&#34;&gt;二、一个简单到令人惊讶的原理&lt;/h2&gt;&#xA;&lt;p&gt;让我们用更具体的方式理解扩散模型在做什么。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：正向过程——&amp;ldquo;毁掉&amp;quot;一张图。&lt;/strong&gt; 训练时，AI拿一张真实的图片（比如一张猫的照片），然后不断地往上加噪声。每一步加一点，直到图像完全变成随机噪声。经过几百步后，你再也看不出原来有只猫了。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：反向过程——&amp;ldquo;修复&amp;quot;一张图。&lt;/strong&gt; AI学习的是&amp;quot;逆向操作&amp;rdquo;——它知道当前这张图有多&amp;quot;脏&amp;rdquo;，然后预测&amp;quot;刚才加进去的噪声是什么样子的&amp;rdquo;，接着减去它。每减去一步，图像就清晰一点。反复做几百步，最终从一团纯噪声中&amp;quot;浮现&amp;quot;出一张清晰的猫图。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键洞察：&lt;/strong&gt; 扩散模型不是在&amp;quot;学习怎么画猫&amp;rdquo;，而是在&lt;strong&gt;学习&amp;quot;噪声长什么样&amp;quot;&lt;/strong&gt;。它学会的是&amp;quot;什么样的噪声不是猫身上的噪声&amp;quot;——换言之，它学会了&amp;quot;猫长什么样&amp;quot;的反面。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很绕，但它的数学本质非常优雅：&lt;strong&gt;AI学习的是数据分布（猫的图片）的梯度方向，然后从随机噪声出发，沿着这个梯度方向一步步&amp;quot;走&amp;quot;到猫的图片。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你站在山顶上，闭着眼睛，只靠感受坡度，一步步走下山——最终你一定能走到山脚。扩散模型从随机噪声出发，一步步&amp;quot;下坡&amp;quot;，最终走到清晰的图像。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三为什么你需要潜空间&#34;&gt;三、为什么你需要&amp;quot;潜空间&amp;quot;？&lt;/h2&gt;&#xA;&lt;p&gt;DDPM（2020年）在理论上很漂亮，但它有一个实际痛点：&lt;strong&gt;太慢了。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在像素空间做去噪，意味着模型要处理512×512×3=78万个像素值。每一步去噪都需要计算这么多数据，而且DDPM需要1000步才能生成一张可用的图。一张图生成完，够你喝两杯咖啡了。&lt;/p&gt;&#xA;&lt;p&gt;2022年，Stable Diffusion的团队提出了一个天才的解决方案：&lt;strong&gt;别在像素空间做，去&amp;quot;潜空间&amp;quot;做。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;什么是&amp;quot;潜空间&amp;quot;？把它想象成&lt;strong&gt;图像的精简版速记表&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;一张512×512的图有78万个像素，但其中大部分信息是冗余的——比如&amp;quot;蓝天&amp;quot;的蓝色，有几千个像素值几乎一样。这些信息不需要逐个处理，只要知道&amp;quot;这里是蓝色&amp;quot;就够了。&lt;/p&gt;&#xA;&lt;p&gt;Stable Diffusion用了一个预训练的自编码器，把一张图像压缩到64×64×4的&amp;quot;潜表示&amp;quot;——&lt;strong&gt;只有约1.6万个数值，是原来的1/48。&lt;/strong&gt; 而且这个压缩是&amp;quot;有损但聪明&amp;quot;的——它保留了语义信息（&amp;ldquo;有一只猫，在草地上&amp;rdquo;），去掉了感知冗余（&amp;ldquo;猫的每根毛的颜色细微差别&amp;rdquo;）。&lt;/p&gt;&#xA;&lt;p&gt;然后，扩散过程在这个压缩后的潜空间里进行。&lt;strong&gt;计算量直接降到了原来的1/48。&lt;/strong&gt; 这就是为什么Stable Diffusion可以在消费级显卡上运行，而DALL-E 2需要云端服务器。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但代价是什么？&lt;/strong&gt; 潜空间压缩丢失了细节。这就是为什么Stable Diffusion生成的图在细节上有时不如DALL-E 2——它在压缩时&amp;quot;丢掉&amp;quot;的那些信息，再也回不来了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四ai真的理解它画的是什么吗&#34;&gt;四、AI真的&amp;quot;理解&amp;quot;它画的是什么吗？&lt;/h2&gt;&#xA;&lt;p&gt;到这里，我们不得不面对一个更根本的问题：&lt;strong&gt;AI在&amp;quot;去噪&amp;quot;的过程中，真的&amp;quot;理解&amp;quot;它画的是什么吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;答案可能会让你失望：&lt;strong&gt;很可能不。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;AI在去噪的过程中，没有&amp;quot;猫&amp;quot;的概念，没有&amp;quot;草地&amp;quot;的概念，没有&amp;quot;蓝天&amp;quot;的概念。它只知道&amp;quot;这个像素的噪声模式，在训练数据中，和这种特定形状常常一起出现&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;它学到的，是一个巨大的统计关联网络——&lt;strong&gt;&amp;ldquo;这种形状的噪声模式，通常意味着这里有猫耳朵&amp;rdquo;&lt;/strong&gt;。但它不知道&amp;quot;猫&amp;quot;是什么，不知道猫会喵喵叫，不知道猫有九条命（至少在传说中）。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它知道的是&amp;quot;猫的统计模式&amp;quot;，而不是&amp;quot;猫&amp;quot;本身。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这不是AI的缺陷，而是它的本质。AI的&amp;quot;理解&amp;quot;和我们人类的&amp;quot;理解&amp;quot;是两种完全不同的东西。人类的&amp;quot;理解&amp;quot;有身体经验、有情感、有文化背景——你知道猫摸起来是什么感觉，你知道猫会蹭你的腿，你知道猫不是&amp;quot;一堆像素的统计模式&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;AI的&amp;quot;理解&amp;quot;是纯粹的统计模式识别——它知道&amp;quot;猫的像素分布&amp;quot;和&amp;quot;狗的像素分布&amp;quot;的区别，但它不知道&amp;quot;猫是宠物&amp;quot;这件事。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但这不妨碍它生成让你惊叹的图像。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;就像你不需要懂空气动力学也能开飞机，AI不需要&amp;quot;理解&amp;quot;猫也能画猫。它只需要知道猫的&amp;quot;统计分布&amp;quot;就够了。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语从对抗到去噪&#34;&gt;结语：从&amp;quot;对抗&amp;quot;到&amp;quot;去噪&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回看AI图像生成的发展史，有一条清晰的线索：从GAN的&amp;quot;对抗&amp;quot;范式，到扩散模型的&amp;quot;去噪&amp;quot;范式。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;对抗范式&lt;/strong&gt;假设智能需要&amp;quot;竞争&amp;quot;——两个网络互相博弈，从中涌现出创造力。这个思路性感，但不稳定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;去噪范式&lt;/strong&gt;假设智能需要&amp;quot;消除&amp;quot;——从混乱中逐步恢复秩序，从噪声中浮现出结构。这个思路朴实，但稳定。&lt;/p&gt;&#xA;&lt;p&gt;而扩散模型之所以成为主流，恰恰是因为它&lt;strong&gt;承认了AI的局限性&lt;/strong&gt;。它不试图&amp;quot;创造&amp;quot;新东西，而是从一个充满可能性的起点（随机噪声）出发，按照训练数据中学到的统计模式，一步步&amp;quot;走到&amp;quot;一个合理的终点。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;创造力不是&amp;quot;凭空产生&amp;quot;，而是&amp;quot;从混乱中浮现秩序&amp;quot;。&lt;/strong&gt; 这不仅是AI的&amp;quot;画画&amp;quot;方式，也可能是人类创造力的本质——我们的大脑，也不过是在无数可能的&amp;quot;噪声&amp;quot;中，找到那个最&amp;quot;合理&amp;quot;的答案。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考资料&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Goodfellow, I. J., et al. (2014). &amp;ldquo;Generative Adversarial Nets.&amp;rdquo; &lt;em&gt;NeurIPS 2014.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/1406.2661&#34;&gt;https://arxiv.org/abs/1406.2661&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ho, J., Jain, A., &amp;amp; Abbeel, P. (2020). &amp;ldquo;Denoising Diffusion Probabilistic Models.&amp;rdquo; &lt;em&gt;NeurIPS 2020.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/2006.11239&#34;&gt;https://arxiv.org/abs/2006.11239&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Rombach, R., et al. (2022). &amp;ldquo;High-Resolution Image Synthesis with Latent Diffusion Models.&amp;rdquo; &lt;em&gt;CVPR 2022.&lt;/em&gt; &lt;a href=&#34;https://arxiv.org/abs/2112.10752&#34;&gt;https://arxiv.org/abs/2112.10752&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;本文核心论证素材来源于论文论证卡库生成模型领域：GAN论证卡、DDPM论证卡、Stable Diffusion论证卡，经Ω-CFI审查框架校验。&lt;/li&gt;&#xA;&lt;/ul&gt;</description>
			</item>
	</channel>
</rss>
