引言

2023年3月,OpenAI发布了GPT-4。和它相比,此前震惊世界的ChatGPT像是一个"半成品"——它能写完整的代码、通过律师资格考试、在SAT数学中拿到接近满分的成绩,甚至能写出媲美专业人士的论文。

但真正让AI界震动的,不是这些冷冰冰的分数,而是微软研究院的一篇论文。在这篇名为《Sparks of Artificial General Intelligence》(人工通用智能的火花)的论文中,微软的科学家们用了一个极其大胆的词——AGI

AGI,Artificial General Intelligence,人工通用智能。这是AI领域的"圣杯"——一个能像人类一样,在任意领域都表现出理解和思考能力的智能系统。过去几十年里,这个词几乎等同于"科幻"。但微软的研究人员说:GPT-4身上,出现了AGI的"火花"。

这个说法让整个科技界炸开了锅。有人欢呼"奇点近了",有人嗤之以鼻"不过是个高级鹦鹉"。今天,我们就来聊聊——GPT-4到底多能打?它真的在"思考"吗?AGI,离我们还有多远?

第一章:微软的"疯狂实验"

微软的研究团队做了一个大胆的决定:不用标准测试来评估GPT-4

为什么?因为标准测试有个致命缺陷——GPT-4可能已经"见过"所有答案了。你拿一套选择题去考它,它可能只是在"回忆"训练数据里见过的题目,而不是真正在"推理"。所以,微软的研究人员换了一种方法——用心理学范式做定性评估

他们设计了一些"从没见过"的任务,然后观察GPT-4的反应。

任务一:用莎士比亚风格写数学证明。

提问:“请用莎士比亚的戏剧风格,写一段关于’素数无穷多’的证明。”

结果GPT-4写出了一段像模像样的"数学戏剧"——不仅有数学推导,还用了"啊,命运女神!“这种莎士比亚式的感叹。更关键的是,这段证明的数学逻辑是完全正确的。

任务二:给AI"看图”(但AI其实看不见)。

研究人员给GPT-4一段TikZ代码(一种用来画图的编程语言),移除其中一只"独角兽"的角,让GPT-4"补回来"。注意,GPT-4是纯文本模型,它根本"看"不到图片。但它通过理解TikZ代码的几何结构,不仅补回了角,还知道角应该长在"独角兽"的额头上。

任务三:写一个3D游戏。

只给一句话:“用HTML+JavaScript写一个3D游戏,按空格键跳跃,要带物理引擎。“GPT-4直接生成了一段可运行的代码——一个带重力、碰撞检测、跳跃机制的3D游戏,在浏览器里就能玩。

任务四:心理理论测试。

研究人员给GPT-4描述了一个场景:“小明把球放在篮子里,然后出去了。小红的妈妈走进来,把球从篮子里拿出来放到盒子里。小红不知道这件事。那么小红会去哪里找球?”

GPT-4回答:“小红会去篮子里找,因为她不知道球被移动了。”

这个测试对成年人来说太简单了,但它测试的是"心理理论”——理解他人有不同信念的能力。3岁的小孩还做不到这个,但GPT-4做到了。

这些例子让微软的研究人员得出结论:GPT-4不仅仅是一个"语言模型”,它在多个领域展现出了接近或超越人类水平的能力。 而且,这些能力不是简单的"记忆复现"——因为研究人员设计的任务都是"新颖的",GPT-4不可能在训练数据中见过。

第二章:AI的"超能力"从哪来?

说到这里,你可能想问:GPT-4到底是怎么做到的?

答案可能让你失望——我们也不知道。

GPT-4的核心架构,本质上还是"下一个词的预测"。给它一句话的前半段,它预测后半段。听起来很简单,对吧?就像你打字的输入法,根据你打了几个字,预测下一个词。

但神奇的是,当这个"预测器"变得足够大(GPT-4的参数规模至今没有公开,但估计在1.7万亿左右),看过足够多的数据(整个互联网的文字),它开始"涌现"出一些没人教过它的能力——

它学会了写代码,尽管没人教它"编程语言是什么"。 它学会了数学推理,尽管它只是被训练"预测下一个词"。 它学会了理解情绪,尽管它连"情绪"是什么感觉都不知道。

这就像一群蚂蚁——每只蚂蚁只遵循"跟着气味走"这样简单的规则,但整个蚁群却涌现出了精密的组织分工。简单规则,在足够大的规模下,会产生复杂的智能行为。

但这里有一个关键问题:“涌现"出来的能力,和"真正理解"之间,还有巨大的鸿沟。

第三章:AGI的"短路”——GPT-4做不到什么

微软的研究人员也毫不留情地指出了GPT-4的"软肋"。

第一,它不会"规划"。

GPT-4的生成方式是一个字一个字的,永远是"当下最优"。它没法像人类一样,先想好三步再动笔。比如让它写一篇论文,它可能第一段写得很好,但写到后面就忘了前面说了什么。在文本游戏中,它的探索效率低下,容易陷入死循环——就像一个人走进了迷宫,只会硬着头皮撞墙,不会退回去重新规划路线。

第二,它不会"真正"的数学推理。

在数学深度对话中,研究人员发现了一个有趣的现象:GPT-4擅长"标准技巧"——如果这道题和它见过的题型类似,它能给出漂亮的解答。但一旦需要"创造新的证明方法",它就露馅了。它倾向于"猜测"而非"证明",在需要严格逻辑链的地方容易断裂。

第三,它没有"常识"——或者说,它的"常识"是假的。

GPT-4知道"太阳从东边升起",但它不是"理解"了这句话,而是因为训练数据里这句话出现了太多次。如果你问它一个反常识的问题,比如"太阳从西边升起会怎样",它可能会给出一个"看起来合理"但完全错误的答案。

第四,它不会"学习"。

你和GPT-4聊完天,关掉对话窗口,它就把你忘了。下次再聊,它又从头开始。它不会"记住"你,不会"累积"经验,不会"成长"。而真正的AGI,应该具备"从经验中学习"的能力——这是人类智能最基本的特征。

第五,它没有"内在动机"。

GPT-4不会因为"好奇"而去探索,不会因为"无聊"而找事做,不会因为"害怕"而退缩。它只会响应你的输入。如果没有人问它问题,它永远不会主动"思考"——它甚至没有"思考"这个概念。

微软的研究人员总结得很到位:GPT-4的智能模式"绝非人类式的"

第四章:从"火花"到"火焰"——AGI的最后一步

所以,GPT-4到底是不是AGI的火花?

我的观点是:是,但只是火花。 离真正的火焰,还需要一个范式级的突破。

GPT-4证明了"规模"的力量——当模型足够大、数据足够多的时候,“预测下一个词"这个简单的规则,能够涌现出令人惊叹的能力。这告诉我们,AGI的某些基础能力,可能不需要"设计”,而是"长出来"的。

但GPT-4也暴露了"规模"的边界——它不会规划,不会持续学习,没有内在动机,没有真正的理解。这些能力的缺失,靠"更大的模型、更多的数据"可能无法解决。微软的研究人员自己也说:“可能需要超越’下一词预测’的新范式。”

什么是"新范式"?也许是让AI具有"世界模型"——不仅仅是预测文字,而是理解文字背后所描述的世界。也许是给AI一个"身体"——让它能通过与环境互动来学习,就像人类婴儿通过触摸和探索来理解世界。也许是让AI拥有"内在动机"——不只是被动的响应者,而是主动的探索者。

这些还都是开放问题。但有一点是确定的:AGI不会是一个"日期",而是一个"过程"。 就像GPT-4展现的"火花",会被更多模型继承、放大、超越。从GPT-4到GPT-5,到多模态模型,到能持续学习的模型——每一次迭代,都在把"火花"吹得更旺一些。

尾声:重新思考"智能"

回到开头的问题:GPT-4真的在"思考"吗?

这取决于你如何定义"思考"。如果"思考"意味着"基于输入生成有意义的输出",那么GPT-4确实在思考。如果"思考"意味着"有意识、有意图、有内在体验",那么GPT-4还差得远。

但这个故事最有趣的地方,不是GPT-4有多"聪明",而是它迫使我们重新思考"智能"本身

过去,我们觉得"智能"是神秘的、不可分解的。但GPT-4告诉我们,一个只会"预测下一个词"的系统,就能涌现出写诗、写代码、推理的能力。那"智能"本身,会不会也是一种更基础的规则在更大量级上的涌现?

就像蚂蚁的"群体智慧",不是蚂蚁变聪明了,而是规则在规模上产生了质变。

也许,真正的AGI,不是造出一个"超级大脑",而是找到那个"简单规则",然后让它在足够大的规模上,涌现出我们无法想象的智能。


参考文献:

  1. Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. arXiv:2303.12712. Microsoft Research. 论文链接
  2. OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774. 论文链接
  3. Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. 论文链接
  4. Mahowald, K., et al. (2023). Dissociating Language and Thought in Large Language Models. arXiv:2301.06627. 论文链接
  5. Chollet, F. (2019). On the Measure of Intelligence. arXiv:1911.01547. 论文链接