引言

你有没有想过一个问题:小孩是怎么学会认猫的?

你不可能给他一张张标注好"这是猫,这不是猫"的照片,然后让他背下来。但神奇的是,他看过几次猫之后,就能自己认出猫——哪怕猫换了姿势、换了光线、换了背景,他都知道"这是猫"。

这听起来理所当然,但对AI来说,这曾经是一个巨大的难题。

传统的AI学习方式,需要大量人工标注的数据。比如你想让AI学会识别猫,你得先给它看几万张标注了"猫"或"不是猫"的照片。这叫监督学习——就像有一个老师,每道题都告诉你正确答案。

但问题来了:世界上有那么多东西需要AI认识,哪有那么多"老师"给每张照片打标签?

这就是自监督学习要解决的问题——让AI像小孩一样,不用老师,自己也能学会


“老师"不够用了

先说说为什么"自监督"这么重要。

传统监督学习有一个致命的瓶颈:标注成本。你让AI识别猫,可能要花几千小时让人工去标注几百万张图片。如果让它识别罕见病CT影像呢?能看懂CT片的医生本来就少,哪来的时间给你一张张标注?

更关键的是,人类的学习方式本身就不是"监督"的。你学会认猫,不是因为有人给你标了数据,而是因为你观察了足够多的猫,自己总结出了规律。你学会了说话,不是因为有人给你一张语法规则表,而是因为你听了足够多的话

所以一个自然的问题就是:能不能让AI也这样学?

答案是可以,而且这条路正在改变整个AI领域。


核心思想:让数据给自己出题

自监督学习的基本思路听起来很巧妙:让数据自己给自己出题

想象一下,你不是直接告诉AI"这张图是猫”,而是把一张猫的照片切成两半,让AI猜"这两半是不是同一张图上的"。AI为了答对这道题,必须学会理解"猫"长什么样、有什么特征——在这个过程中,它自然而然地就学会了识别猫,而你根本不需要给它任何标签。

这就是自监督学习最核心的智慧:不要给AI答案,给它出题,让它自己从题目中学习。

这套方法主要有两大学派,我们来看看它们各自是怎么"出题"的。


流派一:对比学习——“找不同"的反向操作

对比学习(Contrastive Learning) 的思路是:让AI学会区分"相似"和"不相似”。

具体来说,对同一张图片做两种不同的处理——比如裁剪不同区域、调整颜色、旋转角度——得到两张"长得不一样但本质是同一张图"的版本。AI的任务是:把这两张"同源"的图片识别为相似,把来自不同图的图片识别为不相似。

这就像你给AI出题:“这两张图是同一只猫的不同角度,那两张图是两只不同的猫,你给我分出来。”

听起来似乎不难,但真正做起来,里面有很多门道。

SimCLR(Google 2020年提出)是这一派的开创者之一。它的做法很有意思:把同一张图做两种不同的"数据增强"——比如一张剪了左上角还调亮了,另一张剪了右下角还压暗了——然后让AI学会把这两张"增强版"识别为同一张图。为了做到这一点,AI必须理解图片的"本质内容"是什么,而不是被表面变化迷惑。SimCLR在ImageNet上达到了76.5%的Top-1准确率,几乎追平了监督学习的ResNet-50——而这一切,没有使用任何一张人工标注的图片

MoCo(何恺明团队,Facebook 2020)走了另一条路。它用了一个"记忆队列"——把之前见过的所有图片特征都存起来,形成一个巨大的"字典"。当新图片进来时,AI就在这个字典里找"谁和谁长得像"。这个看似简单的设计,让对比学习可以在普通显卡上训练,而不需要大batch size。MoCo在目标检测任务上第一次超越了监督预训练——这意味着自监督学习不仅"够用",在某些场景下甚至比"有老师教"的更好。

BYOL(DeepMind 2020)则更进一步——它连"不相似"的样本都不需要了。它只学"同一张图的两个版本应该相似",完全不用看"不相似的图长什么样"。这就好比一个小孩只盯着猫看,不看狗,竟然也能学会认猫。这个发现打破了学界的共识——原来"负样本"不是必须的。


流派二:掩码预测——“完形填空"的智慧

另一条路更直觉:遮住一部分,让AI猜被遮住的是什么。

MAE(Masked Autoencoders)(何恺明团队,Meta 2022)把这张做到了极致。它随机遮掉一张图片的75%——没错,只留下25%的碎片给AI看,然后让AI复原整张图。

这听起来像是一个"不可能完成的任务”。但正是这种"极度困难"的设定,迫使AI学会了真正的"理解"。你想想,如果你只看到一个人的眼睛和耳朵,要猜出整张脸长什么样——你必须理解"人脸的结构是什么样的"、“眼睛和耳朵之间有什么关系”。

MAE的巧妙之处在于它的"非对称设计":编码器只看那25%的可见碎片(计算量小),解码器负责复原那75%的遮挡部分(稍微重一点但只用一次)。这个设计让训练速度提升了4倍以上。最终,MAE在ImageNet上达到了87.8%的Top-1准确率——已经超过了大多数有监督的方法。

你可能会觉得这很熟悉——没错,就是BERT的思路。BERT遮住文本中的一些词让AI猜,MAE遮住图像中的一些区域让AI复原。“完形填空"这个思路,从文本到图像,通用得令人惊讶。


CLIP:让AI学会"看图说话”

如果说对比学习是"让AI自己学会区分",那么CLIP(OpenAI 2021)就是"让AI学会跨语言的联想"。

CLIP的做法是:在网上找了4亿张图文配对的数据(比如一张猫的照片,配文"一只橘猫趴在窗台上"),然后让AI学会把图片和对应的文字匹配到一起

具体来说,给AI一张图片和一段文字描述,问它:“这张图配这段文字,配不配?“为了答对这道题,AI必须同时理解图片的内容和文字的含义,然后把它们对应起来。

CLIP的神奇之处在于,学完之后,它不需要任何额外的训练数据就能做图像分类。你告诉它"识别猫、狗、鸟”——它自己就能把图片分好类,准确率高达76.2%(ImageNet零样本分类)。这意味着,你不需要给CLIP任何一张标注好的猫照片,它就已经知道猫长什么样了。

今天,CLIP已经成为了Stable Diffusion、DALL·E 2等生成模型的"眼睛”——它让AI既"看得懂图",又"读得懂字"。


为什么"自己学"比"有人教"更重要?

到这里你可能会问:自监督学习确实很酷,但它到底有什么用?跟普通人的生活有什么关系?

关系大了。想想这些场景:

场景一:医疗影像。罕见病的CT影像本来就少,能标注的医生更少。自监督学习可以先让AI"自己看"大量未标注的CT片,学会"正常肺部长什么样",然后再少量标注数据就能学会"识别异常"。这大大降低了对人工标注的依赖。

场景二:多语言翻译。世界上有7000多种语言,大部分语言根本没有足够的标注数据。自监督学习(比如BERT的多语言版本)可以让AI"自己读"大量不同语言的文本,学会"语言之间的对应关系",即使某些语言只有很少的翻译数据。

场景三:自动驾驶。一辆自动驾驶汽车每天会产生TB级别的视频数据,但大部分都是"正常行驶"的普通画面,真正需要标注的"异常场景"非常少。自监督学习可以让AI从这些海量无标注数据中学到"道路的通用规律",而不是只依赖人工标注的少数场景。

自监督学习的真正意义,在于它打破了AI对"人工标注"的依赖。 世界上绝大多数数据——图片、视频、文字、声音——都是没有标签的。如果AI只能从"有标签"的数据中学习,它永远只能理解人类世界的一小部分。而自监督学习,让AI可以像人类一样,从"观察"中自己学习。


结语:从"喂数据"到"自己学"

回到开头的那个问题:小孩是怎么学会认猫的?

答案其实很简单——他不需要"老师"告诉他每张照片是不是猫,他只需要看足够多的猫,大脑就能自己总结出"猫是什么"的规律。

自监督学习做的,正是同一件事:不再给AI"答案",而是给它"问题"——让它从数据本身的结构中,自己发现规律。

从SimCLR到MAE,从对比学习到掩码预测,从CLIP到GPT——这些方法的共同内核是:让数据自己说话。 而这对AI的意义,可能比我们想象的要深远得多。因为当AI学会"自己学"之后,它就不再受限于人类能教它的东西——它可以自己去探索、去发现、去理解那些我们甚至还没想到的知识。

而这,或许才是通往真正智能的那把钥匙。


参考文献:

  1. Chen et al. A Simple Framework for Contrastive Learning of Visual Representations. ICML 2020. arXiv:2002.05709
  2. He et al. Momentum Contrast for Unsupervised Visual Representation Learning. CVPR 2020. arXiv:1911.05722
  3. He et al. Masked Autoencoders Are Scalable Vision Learners. CVPR 2022. arXiv:2111.06377
  4. Grill et al. Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning. NeurIPS 2020. arXiv:2006.07733
  5. Radford et al. Learning Transferable Visual Models From Natural Language Supervision. ICML 2021. arXiv:2103.00020