<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Flow Matching on 灵语AI</title>
		<link>https://lingyu7.com/tags/flow-matching/</link>
		<description>Recent content in Flow Matching on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 28 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/flow-matching/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI画图的&#39;导航系统&#39;革命——Flow Matching：为什么新一代图像模型又快又好？</title>
				<link>https://lingyu7.com/posts/flow-matching-ai-image-generation-revolution/</link>
				<pubDate>Mon, 28 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/flow-matching-ai-image-generation-revolution/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有注意到，最近一两年AI画图的质量突然上了一个大台阶？&lt;/p&gt;&#xA;&lt;p&gt;2024年，Stable Diffusion 3横空出世；2025年，Black Forest Labs的FLUX系列成为Hugging Face上下载量最高的图像生成模型之一；到了2026年，FLUX.2已经能原生输出400万像素的超清图片，而且速度比上一代快了好几倍。&lt;/p&gt;&#xA;&lt;p&gt;这些模型看起来风格各异，但它们背后藏着一个共同的秘密武器——&lt;strong&gt;Flow Matching（流匹配）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个2023年由Meta AI研究院提出的技术框架，正在悄然取代统治AI画图领域多年的扩散模型，成为新一代生成模型的&amp;quot;操作系统&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;从瞎摸索到直线导航一个直觉性的比喻&#34;&gt;从&amp;quot;瞎摸索&amp;quot;到&amp;quot;直线导航&amp;quot;：一个直觉性的比喻&lt;/h2&gt;&#xA;&lt;p&gt;要理解Flow Matching，先想象你站在一个陌生的城市里，需要找到一家餐厅。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;扩散模型的方式&lt;/strong&gt;，就像你把手机关了，只能靠&amp;quot;感觉&amp;quot;走。你大致知道餐厅在北边，于是每走一步就问问路人&amp;quot;我是不是偏了？&amp;quot;，然后微调方向。这条路能走到，但你要走很多步，而且有时候会绕弯路。通常需要20到50步才能到达目的地。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Flow Matching的方式&lt;/strong&gt;，则像打开了导航。它不是让你一步步试探，而是直接给你规划了一条从当前位置到餐厅的最优路线——通常是直线。你只需要沿着这条路线走，4到8步就到了。&lt;/p&gt;&#xA;&lt;p&gt;这就是Flow Matching的核心洞见：&lt;strong&gt;与其让模型在噪声中一步步&amp;quot;去噪&amp;quot;寻找数据，不如直接为每个样本学习一条从噪声到数据的最优路径&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;技术本质模型到底在学习什么&#34;&gt;技术本质：模型到底在学习什么？&lt;/h2&gt;&#xA;&lt;p&gt;让我们稍微深入一点，但不涉及复杂公式。&lt;/p&gt;&#xA;&lt;p&gt;传统扩散模型做的事情是：给一张清晰的图片逐渐加入噪声，直到变成完全的随机噪点。然后反过来，训练一个模型学会&amp;quot;去除噪声&amp;quot;。生成图片时，从一团噪声开始，反复去噪，最终得到清晰图像。&lt;/p&gt;&#xA;&lt;p&gt;这个过程有一个根本性的低效：模型在每一步只需要预测&amp;quot;当前有多少噪声&amp;quot;，但它并不关心全局路径是否最优。就像你每走一步都问路，但没人告诉你终点到底往哪个方向。&lt;/p&gt;&#xA;&lt;p&gt;Flow Matching换了一个思路。它不再让模型预测噪声，而是让模型学习一个&lt;strong&gt;速度场&lt;/strong&gt;——在路径上的每一个点，样本应该往哪个方向走、走多快。&lt;/p&gt;&#xA;&lt;p&gt;具体来说：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;起点&lt;/strong&gt;是一团随机噪声（高斯分布）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;终点&lt;/strong&gt;是真实数据（比如一张猫的照片）&lt;/li&gt;&#xA;&lt;li&gt;模型学习的是：从起点到终点，每个中间时刻样本应该以什么速度、朝什么方向移动&lt;/li&gt;&#xA;&lt;li&gt;生成时，从噪声出发，沿着学到的速度场一步步走到终点&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;关键创新在于路径的选择。扩散模型只有一种固定的&amp;quot;加噪-去噪&amp;quot;路径，而Flow Matching允许你&lt;strong&gt;自由选择路径&lt;/strong&gt;。最聪明的选择是什么呢？走直线。&lt;/p&gt;&#xA;&lt;p&gt;研究者提出了&amp;quot;最优传输路径&amp;quot;（Optimal Transport Path），也就是让每个噪声样本沿直线插值到对应的目标数据。直线是两点之间最短的距离，速度场变化最小，模型最容易学习，采样时需要的步数也最少。&lt;/p&gt;&#xA;&lt;h2 id=&#34;从论文到产品flow-matching如何征服了整个行业&#34;&gt;从论文到产品：Flow Matching如何征服了整个行业&lt;/h2&gt;&#xA;&lt;p&gt;2023年，Lipman等人在ICLR会议上发表了Flow Matching的原始论文。当时很多人只是把它看作扩散模型的一个数学推广——更优雅，但未必实用。&lt;/p&gt;&#xA;&lt;p&gt;结果完全出乎意料。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2024年初&lt;/strong&gt;，Stability AI发布Stable Diffusion 3，这是第一个大规模采用Flow Matching的商业图像模型。它放弃了延续多年的U-Net去噪架构，转而使用Transformer来预测速度场。图像质量和生成速度都有显著提升。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2024年8月&lt;/strong&gt;，Black Forest Labs推出FLUX.1——由Stable Diffusion原始团队的四位核心成员创建。FLUX基于Rectified Flow（一种Flow Matching的直线路径变体），在图像质量和提示词遵循度上全面超越前辈。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2025年底&lt;/strong&gt;，FLUX.2发布，支持400万像素原生输出、多图参考条件生成，Klein版本甚至能在消费级显卡上实现不到1秒的出图速度。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;更令人瞩目的是应用范围的扩展&lt;/strong&gt;。Flow Matching不再局限于图像生成：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;视频生成&lt;/strong&gt;：Meta的Movie Gen（300亿参数）使用Flow Matching生成视频&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;语音合成&lt;/strong&gt;：Meta的Voicebox、开源的F5-TTS都用它生成自然语音&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;分子设计&lt;/strong&gt;：2026年8月的最新论文将Flow Matching用于基于语言引导的3D分子生成&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;量子计算&lt;/strong&gt;：2026年9月，电子科技大学团队在PRX Intelligence发表论文，首次将Flow Matching推广到量子领域&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;一个学术框架，在短短三年内从论文变成了几乎所有生成式AI模态的底层引擎。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么flow-matching能赢三个核心优势&#34;&gt;为什么Flow Matching能赢？三个核心优势&lt;/h2&gt;&#xA;&lt;h3 id=&#34;1-更快的生成速度&#34;&gt;1. 更快的生成速度&lt;/h3&gt;&#xA;&lt;p&gt;这是最直观的优势。扩散模型需要20-50步采样，Flow Matching配合直线路径只需要4-8步。在视频生成这种对计算量极其敏感的场景下，每减少一步都意味着巨大的成本节约。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
