<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI能力边界 on 灵语AI</title>
		<link>https://lingyu7.com/tags/ai%E8%83%BD%E5%8A%9B%E8%BE%B9%E7%95%8C/</link>
		<description>Recent content in AI能力边界 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 17 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ai%E8%83%BD%E5%8A%9B%E8%BE%B9%E7%95%8C/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>当AI开始&#39;思考&#39;——GPT-4的AGI火花与边界</title>
				<link>https://lingyu7.com/posts/when-ai-starts-thinking-gpt4-sparks-of-agi/</link>
				<pubDate>Mon, 17 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/when-ai-starts-thinking-gpt4-sparks-of-agi/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;2023年3月，OpenAI发布了GPT-4。和它相比，此前震惊世界的ChatGPT像是一个&amp;quot;半成品&amp;quot;——它能写完整的代码、通过律师资格考试、在SAT数学中拿到接近满分的成绩，甚至能写出媲美专业人士的论文。&lt;/p&gt;&#xA;&lt;p&gt;但真正让AI界震动的，不是这些冷冰冰的分数，而是微软研究院的一篇论文。在这篇名为《Sparks of Artificial General Intelligence》（人工通用智能的火花）的论文中，微软的科学家们用了一个极其大胆的词——&lt;strong&gt;AGI&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;AGI，Artificial General Intelligence，人工通用智能。这是AI领域的&amp;quot;圣杯&amp;quot;——一个能像人类一样，在任意领域都表现出理解和思考能力的智能系统。过去几十年里，这个词几乎等同于&amp;quot;科幻&amp;quot;。但微软的研究人员说：GPT-4身上，出现了AGI的&amp;quot;火花&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这个说法让整个科技界炸开了锅。有人欢呼&amp;quot;奇点近了&amp;quot;，有人嗤之以鼻&amp;quot;不过是个高级鹦鹉&amp;quot;。今天，我们就来聊聊——GPT-4到底多能打？它真的在&amp;quot;思考&amp;quot;吗？AGI，离我们还有多远？&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章微软的疯狂实验&#34;&gt;第一章：微软的&amp;quot;疯狂实验&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;微软的研究团队做了一个大胆的决定：&lt;strong&gt;不用标准测试来评估GPT-4&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;为什么？因为标准测试有个致命缺陷——GPT-4可能已经&amp;quot;见过&amp;quot;所有答案了。你拿一套选择题去考它，它可能只是在&amp;quot;回忆&amp;quot;训练数据里见过的题目，而不是真正在&amp;quot;推理&amp;quot;。所以，微软的研究人员换了一种方法——&lt;strong&gt;用心理学范式做定性评估&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;他们设计了一些&amp;quot;从没见过&amp;quot;的任务，然后观察GPT-4的反应。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务一：用莎士比亚风格写数学证明。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;提问：&amp;ldquo;请用莎士比亚的戏剧风格，写一段关于&amp;rsquo;素数无穷多&amp;rsquo;的证明。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;结果GPT-4写出了一段像模像样的&amp;quot;数学戏剧&amp;quot;——不仅有数学推导，还用了&amp;quot;啊，命运女神！&amp;ldquo;这种莎士比亚式的感叹。更关键的是，这段证明的数学逻辑是&lt;strong&gt;完全正确&lt;/strong&gt;的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务二：给AI&amp;quot;看图&amp;rdquo;（但AI其实看不见）。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究人员给GPT-4一段TikZ代码（一种用来画图的编程语言），移除其中一只&amp;quot;独角兽&amp;quot;的角，让GPT-4&amp;quot;补回来&amp;quot;。注意，GPT-4是纯文本模型，它根本&amp;quot;看&amp;quot;不到图片。但它通过理解TikZ代码的几何结构，不仅补回了角，还知道角应该长在&amp;quot;独角兽&amp;quot;的额头上。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务三：写一个3D游戏。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;只给一句话：&amp;ldquo;用HTML+JavaScript写一个3D游戏，按空格键跳跃，要带物理引擎。&amp;ldquo;GPT-4直接生成了一段可运行的代码——一个带重力、碰撞检测、跳跃机制的3D游戏，在浏览器里就能玩。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;任务四：心理理论测试。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;研究人员给GPT-4描述了一个场景：&amp;ldquo;小明把球放在篮子里，然后出去了。小红的妈妈走进来，把球从篮子里拿出来放到盒子里。小红不知道这件事。那么小红会去哪里找球？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4回答：&amp;ldquo;小红会去篮子里找，因为她不知道球被移动了。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这个测试对成年人来说太简单了，但它测试的是&amp;quot;心理理论&amp;rdquo;——理解他人有不同信念的能力。3岁的小孩还做不到这个，但GPT-4做到了。&lt;/p&gt;&#xA;&lt;p&gt;这些例子让微软的研究人员得出结论：&lt;strong&gt;GPT-4不仅仅是一个&amp;quot;语言模型&amp;rdquo;，它在多个领域展现出了接近或超越人类水平的能力。&lt;/strong&gt; 而且，这些能力不是简单的&amp;quot;记忆复现&amp;quot;——因为研究人员设计的任务都是&amp;quot;新颖的&amp;quot;，GPT-4不可能在训练数据中见过。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章ai的超能力从哪来&#34;&gt;第二章：AI的&amp;quot;超能力&amp;quot;从哪来？&lt;/h2&gt;&#xA;&lt;p&gt;说到这里，你可能想问：GPT-4到底是怎么做到的？&lt;/p&gt;&#xA;&lt;p&gt;答案可能让你失望——&lt;strong&gt;我们也不知道。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4的核心架构，本质上还是&amp;quot;下一个词的预测&amp;quot;。给它一句话的前半段，它预测后半段。听起来很简单，对吧？就像你打字的输入法，根据你打了几个字，预测下一个词。&lt;/p&gt;&#xA;&lt;p&gt;但神奇的是，当这个&amp;quot;预测器&amp;quot;变得足够大（GPT-4的参数规模至今没有公开，但估计在1.7万亿左右），看过足够多的数据（整个互联网的文字），它开始&amp;quot;涌现&amp;quot;出一些没人教过它的能力——&lt;/p&gt;&#xA;&lt;p&gt;它学会了写代码，尽管没人教它&amp;quot;编程语言是什么&amp;quot;。&#xA;它学会了数学推理，尽管它只是被训练&amp;quot;预测下一个词&amp;quot;。&#xA;它学会了理解情绪，尽管它连&amp;quot;情绪&amp;quot;是什么感觉都不知道。&lt;/p&gt;&#xA;&lt;p&gt;这就像一群蚂蚁——每只蚂蚁只遵循&amp;quot;跟着气味走&amp;quot;这样简单的规则，但整个蚁群却涌现出了精密的组织分工。&lt;strong&gt;简单规则，在足够大的规模下，会产生复杂的智能行为。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但这里有一个关键问题：&amp;ldquo;涌现&amp;quot;出来的能力，和&amp;quot;真正理解&amp;quot;之间，还有巨大的鸿沟。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章agi的短路gpt-4做不到什么&#34;&gt;第三章：AGI的&amp;quot;短路&amp;rdquo;——GPT-4做不到什么&lt;/h2&gt;&#xA;&lt;p&gt;微软的研究人员也毫不留情地指出了GPT-4的&amp;quot;软肋&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，它不会&amp;quot;规划&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4的生成方式是一个字一个字的，永远是&amp;quot;当下最优&amp;quot;。它没法像人类一样，先想好三步再动笔。比如让它写一篇论文，它可能第一段写得很好，但写到后面就忘了前面说了什么。在文本游戏中，它的探索效率低下，容易陷入死循环——就像一个人走进了迷宫，只会硬着头皮撞墙，不会退回去重新规划路线。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，它不会&amp;quot;真正&amp;quot;的数学推理。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在数学深度对话中，研究人员发现了一个有趣的现象：GPT-4擅长&amp;quot;标准技巧&amp;quot;——如果这道题和它见过的题型类似，它能给出漂亮的解答。但一旦需要&amp;quot;创造新的证明方法&amp;quot;，它就露馅了。它倾向于&amp;quot;猜测&amp;quot;而非&amp;quot;证明&amp;quot;，在需要严格逻辑链的地方容易断裂。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，它没有&amp;quot;常识&amp;quot;——或者说，它的&amp;quot;常识&amp;quot;是假的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4知道&amp;quot;太阳从东边升起&amp;quot;，但它不是&amp;quot;理解&amp;quot;了这句话，而是因为训练数据里这句话出现了太多次。如果你问它一个反常识的问题，比如&amp;quot;太阳从西边升起会怎样&amp;quot;，它可能会给出一个&amp;quot;看起来合理&amp;quot;但完全错误的答案。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第四，它不会&amp;quot;学习&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你和GPT-4聊完天，关掉对话窗口，它就把你忘了。下次再聊，它又从头开始。它不会&amp;quot;记住&amp;quot;你，不会&amp;quot;累积&amp;quot;经验，不会&amp;quot;成长&amp;quot;。而真正的AGI，应该具备&amp;quot;从经验中学习&amp;quot;的能力——这是人类智能最基本的特征。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第五，它没有&amp;quot;内在动机&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;GPT-4不会因为&amp;quot;好奇&amp;quot;而去探索，不会因为&amp;quot;无聊&amp;quot;而找事做，不会因为&amp;quot;害怕&amp;quot;而退缩。它只会响应你的输入。如果没有人问它问题，它永远不会主动&amp;quot;思考&amp;quot;——它甚至没有&amp;quot;思考&amp;quot;这个概念。&lt;/p&gt;&#xA;&lt;p&gt;微软的研究人员总结得很到位：&lt;strong&gt;GPT-4的智能模式&amp;quot;绝非人类式的&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从火花到火焰agi的最后一步&#34;&gt;第四章：从&amp;quot;火花&amp;quot;到&amp;quot;火焰&amp;quot;——AGI的最后一步&lt;/h2&gt;&#xA;&lt;p&gt;所以，GPT-4到底是不是AGI的火花？&lt;/p&gt;&#xA;&lt;p&gt;我的观点是：&lt;strong&gt;是，但只是火花。&lt;/strong&gt; 离真正的火焰，还需要一个范式级的突破。&lt;/p&gt;&#xA;&lt;p&gt;GPT-4证明了&amp;quot;规模&amp;quot;的力量——当模型足够大、数据足够多的时候，&amp;ldquo;预测下一个词&amp;quot;这个简单的规则，能够涌现出令人惊叹的能力。这告诉我们，AGI的某些基础能力，可能不需要&amp;quot;设计&amp;rdquo;，而是&amp;quot;长出来&amp;quot;的。&lt;/p&gt;&#xA;&lt;p&gt;但GPT-4也暴露了&amp;quot;规模&amp;quot;的边界——它不会规划，不会持续学习，没有内在动机，没有真正的理解。这些能力的缺失，靠&amp;quot;更大的模型、更多的数据&amp;quot;可能无法解决。微软的研究人员自己也说：&lt;strong&gt;&amp;ldquo;可能需要超越&amp;rsquo;下一词预测&amp;rsquo;的新范式。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;什么是&amp;quot;新范式&amp;quot;？也许是让AI具有&amp;quot;世界模型&amp;quot;——不仅仅是预测文字，而是理解文字背后所描述的世界。也许是给AI一个&amp;quot;身体&amp;quot;——让它能通过与环境互动来学习，就像人类婴儿通过触摸和探索来理解世界。也许是让AI拥有&amp;quot;内在动机&amp;quot;——不只是被动的响应者，而是主动的探索者。&lt;/p&gt;&#xA;&lt;p&gt;这些还都是开放问题。但有一点是确定的：&lt;strong&gt;AGI不会是一个&amp;quot;日期&amp;quot;，而是一个&amp;quot;过程&amp;quot;。&lt;/strong&gt; 就像GPT-4展现的&amp;quot;火花&amp;quot;，会被更多模型继承、放大、超越。从GPT-4到GPT-5，到多模态模型，到能持续学习的模型——每一次迭代，都在把&amp;quot;火花&amp;quot;吹得更旺一些。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声重新思考智能&#34;&gt;尾声：重新思考&amp;quot;智能&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;回到开头的问题：GPT-4真的在&amp;quot;思考&amp;quot;吗？&lt;/p&gt;&#xA;&lt;p&gt;这取决于你如何定义&amp;quot;思考&amp;quot;。如果&amp;quot;思考&amp;quot;意味着&amp;quot;基于输入生成有意义的输出&amp;quot;，那么GPT-4确实在思考。如果&amp;quot;思考&amp;quot;意味着&amp;quot;有意识、有意图、有内在体验&amp;quot;，那么GPT-4还差得远。&lt;/p&gt;&#xA;&lt;p&gt;但这个故事最有趣的地方，不是GPT-4有多&amp;quot;聪明&amp;quot;，而是它&lt;strong&gt;迫使我们重新思考&amp;quot;智能&amp;quot;本身&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;过去，我们觉得&amp;quot;智能&amp;quot;是神秘的、不可分解的。但GPT-4告诉我们，一个只会&amp;quot;预测下一个词&amp;quot;的系统，就能涌现出写诗、写代码、推理的能力。那&amp;quot;智能&amp;quot;本身，会不会也是一种更基础的规则在更大量级上的涌现？&lt;/p&gt;&#xA;&lt;p&gt;就像蚂蚁的&amp;quot;群体智慧&amp;quot;，不是蚂蚁变聪明了，而是规则在规模上产生了质变。&lt;/p&gt;&#xA;&lt;p&gt;也许，真正的AGI，不是造出一个&amp;quot;超级大脑&amp;quot;，而是找到那个&amp;quot;简单规则&amp;quot;，然后让它在足够大的规模上，涌现出我们无法想象的智能。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. &lt;em&gt;arXiv:2303.12712&lt;/em&gt;. Microsoft Research. &lt;a href=&#34;https://arxiv.org/abs/2303.12712&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;OpenAI (2023). GPT-4 Technical Report. &lt;em&gt;arXiv:2303.08774&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.08774&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2201.11903&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Mahowald, K., et al. (2023). Dissociating Language and Thought in Large Language Models. &lt;em&gt;arXiv:2301.06627&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2301.06627&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Chollet, F. (2019). On the Measure of Intelligence. &lt;em&gt;arXiv:1911.01547&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1911.01547&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
