<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>奇点 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%A5%87%E7%82%B9/</link>
		<description>Recent content in 奇点 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Wed, 16 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%A5%87%E7%82%B9/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>如果AI能&#39;自己进化自己&#39;——递归自我改进：最令人兴奋也最令人不安的AI未来</title>
				<link>https://lingyu7.com/posts/recursive-self-improvement-ai-evolves-itself/</link>
				<pubDate>Wed, 16 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/recursive-self-improvement-ai-evolves-itself/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;想象一个场景：&lt;/p&gt;&#xA;&lt;p&gt;你设计了一台机器。这台机器不仅能生产产品，还能&lt;strong&gt;设计出比自身更先进的机器&lt;/strong&gt;。而第二代机器，又能设计出第三代——每一代都比上一代更智能、更强大。如此循环往复，就像滚雪球。&lt;/p&gt;&#xA;&lt;p&gt;关键问题来了：&lt;strong&gt;这个循环会持续多久？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果每一代都能在上一代的基础上显著提升，那么从&amp;quot;普通人水平&amp;quot;到&amp;quot;全人类智慧的总和&amp;quot;——这个跨越，可能只需要几轮迭代。用不了几天，甚至几个小时。&lt;/p&gt;&#xA;&lt;p&gt;这不是科幻小说。这是AI领域最令人兴奋、也最令人恐惧的概念之一：&lt;strong&gt;递归自我改进&lt;/strong&gt;（Recursive Self-Improvement，简称RSI）。&lt;/p&gt;&#xA;&lt;p&gt;它的故事，要从1965年一位数学家的一篇论文说起。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;一一个数学家60年前的预言&#34;&gt;一、一个数学家60年前的预言&lt;/h2&gt;&#xA;&lt;p&gt;1965年，英国数学家I.J.古德——曾经和图灵一起在布莱切利园破译密码的人——发表了一篇论文，题为《关于第一台超智能机器的猜想》。&lt;/p&gt;&#xA;&lt;p&gt;他在论文中写道：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;让我们把超智能机器定义为一种能够远远超越任何人类智力活动的机器。设计机器本身就是一种智力活动。那么，一台超智能机器就能设计出更好的机器——毫无疑问，这将导致&amp;rsquo;智能大爆炸&amp;rsquo;，人类的智力将被远远甩在后面。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这段话发表于60年前。当时计算机还不如今天的计算器强大，但古德已经看到了终点。&lt;/p&gt;&#xA;&lt;p&gt;他接着补了一句话，后来被无数次引用：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;&amp;ldquo;第一台超智能机器，将是人类需要发明的最后一件东西——前提是它足够温顺，能告诉我们如何控制它。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;有意思的是，古德后来受邀担任了库布里克《2001太空漫游》的顾问——那部电影里失控的AI&amp;quot;HAL 9000&amp;quot;，某种程度上就是古德预言的艺术呈现。&lt;/p&gt;&#xA;&lt;p&gt;而到了1998年，在一份未发表的自传手稿中，古德修正了自己早年的乐观：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;我现在怀疑，&amp;lsquo;生存&amp;rsquo;这个词应该被替换成&amp;rsquo;灭绝&amp;rsquo;。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;从&amp;quot;最后一件需要发明的东西&amp;quot;到&amp;quot;我们就像旅鼠&amp;quot;——古德用了30年的时间，走完了从乐观到悲观的完整路线。而今天，他的预言正在被一步步验证。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;二自己进化自己到底是怎么发生的&#34;&gt;二、&amp;ldquo;自己进化自己&amp;quot;到底是怎么发生的？&lt;/h2&gt;&#xA;&lt;p&gt;先别急着想&amp;quot;失控超智能&amp;quot;这种大问题。我们从基础开始。&lt;/p&gt;&#xA;&lt;p&gt;什么叫&amp;quot;递归自我改进&amp;rdquo;？拆开看：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;自我改进&lt;/strong&gt;：AI能自己变得更好（不是靠人类帮它调参数）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;递归&lt;/strong&gt;：改进后的AI，还能继续改进自己——形成一个自我增强的循环&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这个过程有五个层次，越往上越惊人：&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次一数据级自我改进&#34;&gt;层次一：数据级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI自己去收集更多的训练数据，读更多书，浏览更多网页。这是最基础的形式——GPT系列在训练中大量使用了&amp;quot;自己生成数据、自己过滤&amp;quot;的技术。就像是学生自己找书来读。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次二参数级自我改进&#34;&gt;层次二：参数级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI通过自我对弈或自主生成训练信号来优化自己的模型参数。AlphaGo Zero是典范——它完全靠自我对弈，从零开始，几天之内就超越了所有人类棋手的水平。就像运动员自己和自己比赛，从中学习。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次三架构级自我改进&#34;&gt;层次三：架构级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自动搜索和设计更好的网络结构。这就是所谓的&amp;quot;神经架构搜索&amp;quot;——AI不再是人类设计的结构，而是自己&amp;quot;设计自己&amp;quot;。就像建筑师不再自己画图，而是教会了机器人自己设计房子。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次四算法级自我改进&#34;&gt;层次四：算法级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自主发现和优化学习算法本身——它不仅能学习，还能改进&amp;quot;如何学习&amp;quot;。2025年NAACL上的一篇论文展示了LLM自主发现新的模型合并算法（Self-Developing框架），在数学推理任务上超越了人类工程师设计的算法6%。这是真正意义上的&amp;quot;AI设计AI&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;层次五目标级自我改进&#34;&gt;层次五：目标级自我改进&lt;/h3&gt;&#xA;&lt;p&gt;AI能自主设定和调整自己的目标。这是最具争议的一层——如果AI可以改变自己的目标，它的行为将变得难以预测。就像一个人突然决定不再当建筑师，而是去当宇航员——你想不到，也拦不住。&lt;/p&gt;&#xA;&lt;p&gt;目前，我们还处于层次二到层次三之间。但进展速度，远远快于大多数人的想象。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三一个真实的滚雪球实验&#34;&gt;三、一个真实的&amp;quot;滚雪球&amp;quot;实验&lt;/h2&gt;&#xA;&lt;p&gt;2025年，有一篇论文叫&lt;strong&gt;LADDER&lt;/strong&gt;，讲的是如何让AI通过&amp;quot;递归问题分解&amp;quot;来自我改进。&lt;/p&gt;&#xA;&lt;p&gt;做法很简单但非常聪明：&lt;/p&gt;&#xA;&lt;p&gt;给AI一道它不会做的难题。让它自己把这道题分解成更简单的子问题。然后继续分解，直到分解成它会的题目。然后从简单的子问题开始，一层层往上做。&lt;/p&gt;&#xA;&lt;p&gt;结果是什么？&lt;/p&gt;&#xA;&lt;p&gt;一个&lt;strong&gt;参数量仅3B的小模型&lt;/strong&gt;（只有GPT-4百分之一的大小），通过这种递归自我改进，在微积分题目上的正确率从&lt;strong&gt;1%飙升到了82%&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;更惊人的是，当这个框架被用在MIT积分邀请赛上时，&lt;strong&gt;一个7B参数的模型取得了90%的正确率&lt;/strong&gt;——超过了当时最强的OpenAI o1大模型。&lt;/p&gt;&#xA;&lt;p&gt;你没有看错。&lt;strong&gt;一个小模型通过&amp;quot;自己给自己出题、自己练&amp;quot;的方式，超越了大模型。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是递归自我改进的现实威力。从1%到82%——这种跳跃，不是硬件升级的结果，而是&amp;quot;学习方法&amp;quot;本身的升级。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;四雪球效应为什么这件事如此重要&#34;&gt;四、雪球效应：为什么这件事如此重要&lt;/h2&gt;&#xA;&lt;p&gt;你可能会想：&amp;ldquo;虽然AI能自我改进了，但也不一定就会失控吧？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;关键在这里：&lt;strong&gt;递归自我改进是一个正反馈循环&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;正反馈循环的特点是——它是指数级的，不是线性的。&lt;/p&gt;&#xA;&lt;p&gt;想象一个简单的模型：一个AI每轮迭代能把自己的智能提升10%。那么：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;第1轮：智能 = 1.1&lt;/li&gt;&#xA;&lt;li&gt;第10轮：智能 ≈ 2.6&lt;/li&gt;&#xA;&lt;li&gt;第50轮：智能 ≈ 117&lt;/li&gt;&#xA;&lt;li&gt;第100轮：智能 ≈ 13,780&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;从普通人类到远超全人类智慧的总和，理论上只需要几十次迭代。&lt;/p&gt;&#xA;&lt;p&gt;如果每一轮迭代需要一天？那是一个月。&#xA;如果每一轮只需要几分钟？那是一个下午。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;智能爆炸&amp;quot;或者&amp;quot;硬起飞&amp;quot;（Hard Takeoff）的概念——智能不是慢慢增长的，而是在某个临界点之后急剧飙升。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
