<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>计算机视觉 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/</link>
		<description>Recent content in 计算机视觉 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 13 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;超能力&#39;——CLIP如何让机器同时看懂文字和图像</title>
				<link>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</link>
				<pubDate>Thu, 13 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/clip-ai-sees-world-through-text-and-images/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一下：你看到一张照片——一只橘猫坐在窗台上，夕阳把它的毛染成了金色。你不仅知道&amp;quot;这是猫&amp;quot;，还能感受到&amp;quot;温暖、安静、傍晚&amp;quot;。你甚至能在脑海中把这个画面描述成一段文字。&lt;/p&gt;&#xA;&lt;p&gt;但AI呢？传统AI只能做一件事：要么它会说&amp;quot;这张图片中有猫，置信度98%&amp;quot;，要么它只能处理文字，根本看不懂图片。&lt;strong&gt;它没有&amp;quot;通感&amp;quot;——无法把视觉和语言联系起来。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;2021年，OpenAI发布了一个名为CLIP的模型，彻底改变了这一切。它让AI学会了&amp;quot;一边看一边读&amp;quot;的能力，就像人类天生具备的那样。今天，我们就来聊聊CLIP——这个让AI拥有&amp;quot;超能力&amp;quot;的模型，到底是怎么工作的，以及它为什么如此重要。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章ai的单向道困境&#34;&gt;第一章：AI的&amp;quot;单向道&amp;quot;困境&lt;/h2&gt;&#xA;&lt;p&gt;要理解CLIP的突破，先要知道AI的&amp;quot;老毛病&amp;quot;是什么。&lt;/p&gt;&#xA;&lt;p&gt;在CLIP之前，计算机视觉领域的&amp;quot;标准答案&amp;quot;是监督学习：给AI看几百万张人工标注好的图片，每张图片都附着一个标签——&amp;ldquo;猫&amp;rdquo;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;汽车&amp;rdquo;、&amp;ldquo;飞机&amp;rdquo;。AI的任务就是记住这些标签，然后下次看到新的图片时，说出它属于哪个类别。&lt;/p&gt;&#xA;&lt;p&gt;ImageNet，这个用了十年之久的标准数据集，由2.5万人花了几个月时间，标注了1,400万张图片。这听起来已经很了不起了，对吧？&lt;/p&gt;&#xA;&lt;p&gt;但问题在于：&lt;strong&gt;地球上只有1,400万种东西吗？当然不是。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你打开手机相册，随便翻一张照片——比如&amp;quot;桌上放着一杯星巴克拿铁，旁边是今天刚买的书&amp;quot;。这种组合，ImageNet里不会有。AI只学过&amp;quot;杯子&amp;quot;和&amp;quot;书&amp;quot;这两个独立标签，它无法理解&amp;quot;一杯星巴克拿铁放在一本书旁边&amp;quot;这个完整的场景。&lt;/p&gt;&#xA;&lt;p&gt;更糟糕的是，如果你想教会AI识别一个新类别，比如&amp;quot;戴帽子的企鹅&amp;quot;，你需要重新让人标注几万张戴帽子的企鹅的照片，然后从头训练模型。&lt;strong&gt;每增加一个类别，就要重新标注、重新训练。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是AI的&amp;quot;单向道&amp;quot;困境：它只能识别训练时见过的类别，而且永远无法理解&amp;quot;标签之外&amp;quot;的世界。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章clip的天才想法&#34;&gt;第二章：CLIP的&amp;quot;天才想法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;2021年，OpenAI的研究团队提出了一个简单到令人震惊的想法：&lt;strong&gt;为什么不让AI自己去互联网上&amp;quot;自学&amp;quot;图文关系？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;互联网上有海量的图文对——一张照片配上一段文字描述。比如一张猫的照片，下面写着&amp;quot;这只橘猫正在窗台上晒太阳&amp;quot;。这些数据不需要人工标注，它们自然存在于互联网的每个角落。&lt;/p&gt;&#xA;&lt;p&gt;CLIP（Contrastive Language-Image Pre-training）的核心思路是：&lt;strong&gt;训练两个&amp;quot;编码器&amp;quot;，一个负责&amp;quot;看&amp;quot;图片，一个负责&amp;quot;读&amp;quot;文字，然后把它们看到/读到的东西映射到同一个&amp;quot;语义空间&amp;quot;中。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你有一个巨大的图书馆，里面所有的书都有封面和书名。你让一个助手（图像编码器）专门看封面，另一个助手（文本编码器）专门读书名。然后你让两个助手合作：把封面和书名匹配起来。&lt;/p&gt;&#xA;&lt;p&gt;一开始，两个助手都不认识对方的工作。但经过4亿次&amp;quot;配对练习&amp;quot;后，他们逐渐达成了默契——当封面是一只猫，书名是&amp;quot;橘猫晒太阳&amp;quot;时，他们就学会了把&amp;quot;猫的视觉特征&amp;quot;和&amp;quot;猫的文字描述&amp;quot;关联起来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;CLIP的&amp;quot;天才&amp;quot;之处在于：它不需要人类告诉它&amp;quot;这是什么&amp;quot;。它自己从互联网上海量的图文对中，学会了理解&amp;quot;图像和文字之间的关系&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章一场4亿次连连看游戏&#34;&gt;第三章：一场4亿次&amp;quot;连连看&amp;quot;游戏&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的训练过程，本质上是一场规模巨大的&amp;quot;连连看&amp;quot;游戏。&lt;/p&gt;&#xA;&lt;p&gt;假设你有一个批次（batch）包含N张图片和N段文字描述。你把所有图片和所有文字两两配对，形成N×N个可能的组合。其中只有N个组合是&amp;quot;正确的配对&amp;quot;（图片和它对应的文字描述），其余N²-N个都是&amp;quot;错误配对&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的任务就是：&lt;strong&gt;把正确的配对拉近，把错误的配对推远。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这听起来像是一个简单的任务，但关键在&amp;quot;拉近&amp;quot;和&amp;quot;推远&amp;quot;的尺度上。CLIP使用了一种叫做&amp;quot;对比损失&amp;quot;的方法——它不仅要让正确配对的图文在语义空间中距离很近，还要让错误配对的图文距离足够远。而且，它同时优化两个方向：从图片找文字，从文字找图片。&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;双向对称&amp;quot;的设计，让CLIP学会了真正的&amp;quot;图文通感&amp;quot;——它不只是知道&amp;quot;这张图配这段文字&amp;quot;，而是理解了&amp;quot;这类视觉特征对应这类语义特征&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;更令人惊讶的是，CLIP在训练过程中&lt;strong&gt;完全没有使用人工标注&lt;/strong&gt;。它的4亿图文对全部来自互联网上未经清洗的原始数据——可以说，CLIP是从&amp;quot;野生&amp;quot;互联网中自学成才的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章零样本的魔法&#34;&gt;第四章：零样本的&amp;quot;魔法&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;CLIP最令人震撼的能力，是它的&amp;quot;零样本学习&amp;quot;——&lt;strong&gt;不需要专门训练，就能识别从未见过的类别。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象一下，你教一个孩子认识了&amp;quot;猫&amp;quot;、&amp;ldquo;狗&amp;rdquo;、&amp;ldquo;鸟&amp;quot;这三种动物。现在你拿一张&amp;quot;斑马&amp;quot;的照片给他看，他肯定不认识。但如果你告诉他&amp;quot;斑马是一种像马一样、身上有黑白条纹的动物&amp;rdquo;，他就能立刻理解——因为他把&amp;quot;马&amp;quot;的视觉特征和&amp;quot;黑白条纹&amp;quot;这个文字描述组合起来了。&lt;/p&gt;&#xA;&lt;p&gt;CLIP的工作原理，本质上就是这种&amp;quot;组合理解&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;当你给CLIP一张图片，让它判断&amp;quot;这是什么&amp;quot;时，它不会像传统AI那样去查一个固定的类别列表。相反，你给它一段文字描述——比如&amp;quot;一张斑马的照片&amp;quot;——CLIP会计算这张图片和这段文字在语义空间中的距离。如果距离足够近，它就认为&amp;quot;对上了&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这意味着：&lt;strong&gt;你可以随时告诉CLIP一个新的类别，它立刻就能识别。&lt;/strong&gt; 不需要重新训练，不需要重新标注数据。&lt;/p&gt;&#xA;&lt;p&gt;在ImageNet的零样本测试中，CLIP达到了76.2%的准确率——与一个经过全监督训练的ResNet-50模型不相上下。而ResNet-50是在人工标注的120万张图片上训练出来的，CLIP却一张标注数据都没用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章clip改变了什么&#34;&gt;第五章：CLIP改变了什么&lt;/h2&gt;&#xA;&lt;p&gt;CLIP的出现，不仅是一个技术突破，更是一个&amp;quot;范式转变&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它终结了&amp;quot;标注依赖&amp;quot;的时代。&lt;/strong&gt; 在过去，每做一个新任务，就要重新标注数据。CLIP证明了：自然语言本身就是最好的监督信号。互联网上无处不在的图文对，比任何人工标注数据集都更丰富、更多样、更便宜。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它开启了&amp;quot;多模态AI&amp;quot;的大门。&lt;/strong&gt; CLIP证明了图文之间的&amp;quot;语义对齐&amp;quot;是可行的。之后，DALL·E用它做图像生成，Stable Diffusion用它做文生图，BLIP和LLaVA用它做图文理解——CLIP几乎成了多模态AI的&amp;quot;通用底座&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它改变了我们思考AI的方式。&lt;/strong&gt; 传统AI的思维是&amp;quot;识别&amp;quot;——识别出这是什么。CLIP的思维是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系。这听起来像是一个微妙的差别，但本质上，这是从&amp;quot;记忆&amp;quot;到&amp;quot;理解&amp;quot;的跨越。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第六章clip的盲区&#34;&gt;第六章：CLIP的&amp;quot;盲区&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;当然，CLIP并不完美。它也有自己的&amp;quot;盲区&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个盲区：细粒度理解。&lt;/strong&gt; CLIP能认出&amp;quot;猫&amp;quot;，但分不清&amp;quot;布偶猫&amp;quot;和&amp;quot;暹罗猫&amp;quot;的区别。它的理解是&amp;quot;粗粒度&amp;quot;的，就像你能认出&amp;quot;汽车&amp;quot;，但分不清&amp;quot;宝马3系&amp;quot;和&amp;quot;奔驰C级&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个盲区：计数能力。&lt;/strong&gt; 给CLIP看一张图片，问它&amp;quot;图片里有几只鸟&amp;quot;，它大概率会答错。CLIP理解的是&amp;quot;语义&amp;quot;而不是&amp;quot;数量&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个盲区：抽象推理。&lt;/strong&gt; CLIP能理解&amp;quot;一只狗在追球&amp;quot;，但无法理解&amp;quot;如果狗追到了球，接下来会发生什么&amp;quot;。它没有&amp;quot;因果推理&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四个盲区：位置感知。&lt;/strong&gt; CLIP知道图片中有&amp;quot;猫&amp;quot;和&amp;quot;沙发&amp;quot;，但不知道&amp;quot;猫在沙发上面&amp;quot;还是&amp;quot;猫在沙发旁边&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这些盲区，恰恰是后来研究者们努力突破的方向——BLIP-2加入了更精细的视觉理解，Flamingo引入了时序推理，ImageBind扩展到了六种模态（图像、文字、音频、深度、热成像、IMU）。CLIP不是终点，而是一个起点。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声ai的通感时代&#34;&gt;尾声：AI的&amp;quot;通感&amp;quot;时代&lt;/h2&gt;&#xA;&lt;p&gt;今天的你，打开手机相册搜索&amp;quot;夕阳&amp;quot;，AI能准确地找出所有夕阳的照片——如果倒退到2020年，这个功能几乎不可能实现。你告诉AI&amp;quot;帮我生成一张穿着宇航服的猫在火星上散步的图片&amp;quot;，AI能做到——DALL·E和Stable Diffusion的背后，都站着CLIP。&lt;/p&gt;&#xA;&lt;p&gt;CLIP教会AI的，不是&amp;quot;识别&amp;quot;，而是&amp;quot;理解&amp;quot;——理解图像和文字之间的关系，理解视觉和语义之间的桥梁。&lt;/p&gt;&#xA;&lt;p&gt;这种能力，我们叫它&amp;quot;多模态理解&amp;quot;。而人类最擅长的，恰恰就是多模态理解——我们同时用眼睛看、用耳朵听、用语言描述、用身体感受，我们把来自不同感官的信息整合在一起，形成一个完整的&amp;quot;世界模型&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI正在走的路，就是人类已经走过的路。只是这一次，我们既是老师，也是学生。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2103.00020&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Jia, C., et al. (2021). Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. &lt;em&gt;ICML 2021&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2102.05918&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Li, J., et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. &lt;em&gt;ICML 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2301.12597&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Alayrac, J. B., et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2204.14198&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Girdhar, R., et al. (2023). ImageBind: One Embedding Space To Bind Them All. &lt;em&gt;CVPR 2023&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2305.05665&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
