<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>对比学习 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%AF%B9%E6%AF%94%E5%AD%A6%E4%B9%A0/</link>
		<description>Recent content in 对比学习 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 21 Jul 2026 02:31:20 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%AF%B9%E6%AF%94%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>自学成才的AI——没有老师，它是怎么学会「看懂」世界的？</title>
				<link>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</link>
				<pubDate>Tue, 21 Jul 2026 02:31:20 +0800</pubDate>
				<guid>https://lingyu7.com/posts/self-supervised-learning-ai-sees-without-teacher/</guid>
				<description>&lt;hr&gt;&#xA;&lt;h2 id=&#34;description-ai不需要人类一张张标注图片就能学会看懂世界自监督学习让ai自己给自己出题自己批改本文从simclrmae到byol拆解三种自学策略的本质并追问它们真的理解了还是只是在玩一个聪明的游戏&#34;&gt;title: &amp;ldquo;自学成才的AI——没有老师，它是怎么学会「看懂」世界的？&amp;rdquo;&#xA;date: 2026-07-21T02:29:00+08:00&#xA;draft: false&#xA;tags: [&amp;ldquo;自监督学习&amp;rdquo;, &amp;ldquo;对比学习&amp;rdquo;, &amp;ldquo;MAE&amp;rdquo;, &amp;ldquo;SimCLR&amp;rdquo;, &amp;ldquo;BYOL&amp;rdquo;, &amp;ldquo;表征学习&amp;rdquo;, &amp;ldquo;AI训练&amp;rdquo;, &amp;ldquo;无监督学习&amp;rdquo;]&#xA;categories: [&amp;ldquo;AI深度&amp;rdquo;]&#xA;description: &amp;ldquo;AI不需要人类一张张标注图片就能学会「看懂」世界——自监督学习让AI自己给自己出题、自己批改。本文从SimCLR、MAE到BYOL，拆解三种「自学」策略的本质，并追问：它们真的「理解」了，还是只是在玩一个聪明的游戏？&amp;rdquo;&lt;/h2&gt;&#xA;&lt;h2 id=&#34;引言你给ai看了一亿张图但没告诉它任何一张是什么&#34;&gt;引言：你给AI看了一亿张图，但没告诉它任何一张是什么&lt;/h2&gt;&#xA;&lt;p&gt;想象你是一个刚出生的婴儿，被扔进一个充满图片的世界。&lt;/p&gt;&#xA;&lt;p&gt;没有人指着猫说&amp;quot;这是猫&amp;quot;，没有人告诉你&amp;quot;这是红色&amp;quot;、&amp;ldquo;那是圆形&amp;rdquo;。你只能自己看、自己比较、自己找规律。&lt;/p&gt;&#xA;&lt;p&gt;你会怎么学习？&lt;/p&gt;&#xA;&lt;p&gt;这个问题的答案，指向了AI领域过去几年最深层的变革之一——&lt;strong&gt;自监督学习&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI训练方式很&amp;quot;娇气&amp;quot;：需要人类一张一张地标注数据。&amp;ldquo;这张图是猫，那张图是狗，这张是车……&amp;rdquo; 标注一亿张图需要的人力成本，够一个中型公司破产好几次。&lt;/p&gt;&#xA;&lt;p&gt;但现实世界的数据是没有标签的——互联网上每天产生数亿张图片，没人在上面写&amp;quot;这是风景&amp;quot;或&amp;quot;这是美食&amp;quot;。如果AI只能从有标签的数据中学习，它的&amp;quot;视野&amp;quot;就永远被人类标注的边界所限制。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自监督学习改变了这一切。&lt;/strong&gt; 它让AI在没有人类老师的情况下，自己从海量无标签数据中学习。&lt;/p&gt;&#xA;&lt;p&gt;但问题是：&lt;strong&gt;AI真的&amp;quot;学会&amp;quot;了吗？还是只是在玩一场自己设计规则的、精妙的游戏？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一策略一找不同这两张图是同一个东西吗&#34;&gt;一、策略一：找不同——&amp;ldquo;这两张图是同一个东西吗？&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第一种自监督学习策略，叫&lt;strong&gt;对比学习&lt;/strong&gt;。它的思路简单到令人发指：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;给AI看两张图，问它：这两张是同一个东西的&amp;quot;变体&amp;quot;，还是完全不同的东西？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;以SimCLR（2020年Google提出）为代表，这套方法的玩法是这样的：&lt;/p&gt;&#xA;&lt;p&gt;第一步：从一张猫的图片出发，做两次不同的&amp;quot;整容&amp;quot;——一次把它旋转+裁剪，一次给它调色+模糊。这两张&amp;quot;整容后&amp;quot;的图片，就是&amp;quot;正样本对&amp;quot;——它们是同一个东西的不同版本。&lt;/p&gt;&#xA;&lt;p&gt;第二步：再从同一个训练批次里，随机抓一堆其他图片（狗、车、树……），作为&amp;quot;负样本&amp;quot;——这些是&amp;quot;不同东西&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;第三步：让AI把所有图片映射到一个&amp;quot;嵌入空间&amp;quot;里——一个高维的&amp;quot;特征地图&amp;quot;。要求是：&lt;strong&gt;正样本对在空间里靠得近，负样本对在空间里离得远&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;就这么简单？差不多。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个巨大的派对上，所有人戴着面具。你的任务是：找到你的双胞胎兄弟。&lt;/p&gt;&#xA;&lt;p&gt;你只有一次机会——你可以在人群中任意选两个人，问：&amp;ldquo;他们是不是同一个人的不同造型？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;每问一次，你就学到一点特征：哦，原来我兄弟的&lt;strong&gt;身形轮廓&lt;/strong&gt;是稳定的，但&lt;strong&gt;衣服颜色&lt;/strong&gt;可以变；原来他的&lt;strong&gt;身高&lt;/strong&gt;是特征，但&lt;strong&gt;站姿&lt;/strong&gt;不是。&lt;/p&gt;&#xA;&lt;p&gt;SimCLR做的就是这件事——只不过它问了上亿次。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果如何？&lt;/strong&gt; 惊人地好。SimCLR在ImageNet上的分类准确率达到了76.5%，接近甚至超过了当时许多有监督学习方法。而且它学到的&amp;quot;视觉特征&amp;quot;非常通用——不仅在分类任务上表现好，在目标检测、语义分割等其他任务上也能迁移使用。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但问题来了：它真的&amp;quot;理解&amp;quot;猫是什么了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;仔细想想SimCLR实际在做的事：它只是被训练去&amp;quot;让同一张图片的两个增强版本靠近，让不同图片的版本远离&amp;quot;。它从来没有被告知&amp;quot;猫&amp;quot;这个概念，也不知道&amp;quot;猫&amp;quot;和&amp;quot;狗&amp;quot;的边界在哪里。&lt;/p&gt;&#xA;&lt;p&gt;它能区分猫和狗，是因为&lt;strong&gt;猫和狗在自然图像中的底层结构差异足够大&lt;/strong&gt;——它们占据的&amp;quot;像素空间&amp;quot;区域天然不同，经过增强后仍然不同。SimCLR的&amp;quot;靠近/远离&amp;quot;操作，恰好利用了这种天然差异。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;也就是说：SimCLR不是在&amp;quot;理解语义&amp;quot;，而是在&amp;quot;利用数据的统计结构&amp;quot;。&lt;/strong&gt; 它发现了一个&amp;quot;好用的区分方式&amp;quot;，但这个方式恰好与人类的语义类别对齐了。&lt;/p&gt;&#xA;&lt;p&gt;这不是坏事——实际上，这种&amp;quot;对齐&amp;quot;正是自监督学习的核心价值。但认识到这一点很重要：&lt;strong&gt;AI的&amp;quot;聪明&amp;quot;和人类的&amp;quot;理解&amp;quot;，底层逻辑可能完全不同。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二策略二填空遮住大部分猜出少部分&#34;&gt;二、策略二：填空——&amp;ldquo;遮住大部分，猜出少部分&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;第二种策略，来自一个更直观的想法：&lt;strong&gt;如果你能完美地猜出被遮住的部分，说明你真的理解了整体。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是MAE（Masked Autoencoder，掩码自编码器，2021年Meta提出）的核心思路。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;玩法是这样的：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;第一步：把一张猫的图片切成196个16x16的小块，然后&lt;strong&gt;随机遮住其中75%——只留49个小块可见&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;第二步：把剩下的49个可见小块输入编码器，让编码器&amp;quot;看&amp;quot;这49个碎片。&lt;/p&gt;&#xA;&lt;p&gt;第三步：用一个轻量解码器，从这49个碎片中&lt;strong&gt;重建出全部的196个小块&lt;/strong&gt;——包括被遮住的那147个。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;关键点：&lt;/strong&gt; 编码器只看25%的碎片，解码器必须重建100%的图像。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;为什么遮住75%这么极端？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;因为如果只遮住10%，AI可以靠&amp;quot;邻接像素的颜色渐变&amp;quot;来填充——就像你在Photoshop里用&amp;quot;内容感知填充&amp;quot;一样。但遮住75%后，邻接信息几乎没有了，AI必须真正理解&amp;quot;这张图里有一只猫在草地上&amp;quot;才能猜出猫耳朵的位置、草地的纹理。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;打个比方：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;给你看一张拼图的25块碎片，要你猜出整幅拼图的内容——包括你完全没看到的那些碎片。&lt;/p&gt;&#xA;&lt;p&gt;如果你猜对了，那说明你真的从这些碎片中&amp;quot;推导&amp;quot;出了整幅图的结构——而不是简单地&amp;quot;填补&amp;quot;了空白。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MAE的效果更是惊人：&lt;/strong&gt; 在ImageNet上达到了87.8%的Top-1准确率，并且展现出极强的规模扩展性——模型越大，效果越好。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但它真的&amp;quot;理解&amp;quot;了吗？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;从Ω-CFI框架来看，MAE的本质是一个&lt;strong&gt;高维空间中的条件生成模型&lt;/strong&gt;：给定稀疏的观测（25%的可见块），在隐空间中构建一个&amp;quot;低秩流形&amp;quot;，让缺失部分在这个流形上的投影误差最小。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
