<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>PPO on 灵语AI</title>
		<link>https://lingyu7.com/tags/ppo/</link>
		<description>Recent content in PPO on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 22 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/ppo/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;试错&#39;学习法——强化学习如何让AI从失败中学会成功</title>
				<link>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</link>
				<pubDate>Sat, 22 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/how-reinforcement-learning-ai-learns-from-failure/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有想过一个问题：AlphaGo 是怎么学会下围棋的？它不可能像人类一样翻棋谱、背定式——它甚至连&amp;quot;围棋是什么&amp;quot;都不理解。但2016年，它却以4:1击败了世界冠军李世石。&lt;/p&gt;&#xA;&lt;p&gt;更神奇的是，AlphaGo 的&amp;quot;学习&amp;quot;方式，本质上和你教狗坐下没什么区别：做对了，给奖励；做错了，没奖励。反复试错，直到学会。&lt;/p&gt;&#xA;&lt;p&gt;这听起来简单，但背后隐藏着一个深刻的问题——&lt;strong&gt;如果AI没有人类的逻辑推理能力，它如何通过&amp;quot;瞎试&amp;quot;学会复杂技能？&lt;/strong&gt; 这就是强化学习的核心谜题，也是今天AI领域最令人着迷的技术之一。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;不是教是练&#34;&gt;不是&amp;quot;教&amp;quot;，是&amp;quot;练&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;先区分一个常见的误解。很多人以为AI变聪明，是因为工程师&amp;quot;教&amp;quot;了它很多东西——比如给它看几百万张猫的照片，它就能识别猫。&lt;/p&gt;&#xA;&lt;p&gt;这叫&lt;strong&gt;监督学习&lt;/strong&gt;，确实很强大，但它有一个致命缺陷：你必须先知道正确答案。你不可能给AlphaGo几百万张&amp;quot;这步棋应该下在哪儿&amp;quot;的标注数据，因为围棋的每一步都没有标准答案。&lt;/p&gt;&#xA;&lt;p&gt;强化学习走的是另一条路：&lt;strong&gt;不教，只练&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;想象你在一个黑暗的迷宫里，每走一步，可能踩到金币（+1分），也可能踩到陷阱（-10分）。你一开始完全不知道方向，只能乱走。但走着走着，你发现往左转容易踩到金币，往右转容易掉进陷阱——于是你学会了一个策略：&amp;ldquo;往左转&amp;rdquo;。&lt;/p&gt;&#xA;&lt;p&gt;这就是强化学习最基本的逻辑：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;智能体&lt;/strong&gt; → 做决策的AI（比如你）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;环境&lt;/strong&gt; → 它身处其中的世界（比如迷宫）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;动作&lt;/strong&gt; → 它每一步的选择（比如左转、右转）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;奖励&lt;/strong&gt; → 行动的反馈（金币+1，陷阱-10）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;策略&lt;/strong&gt; → 学习的成果（&amp;ldquo;往左转&amp;quot;这个规则）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;没有老师，没有标准答案，只有&amp;quot;这个动作之后，我得到了什么反馈&amp;rdquo;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从乱试到会试探索与利用的博弈&#34;&gt;从&amp;quot;乱试&amp;quot;到&amp;quot;会试&amp;quot;——探索与利用的博弈&lt;/h2&gt;&#xA;&lt;p&gt;但这里有一个矛盾：如果你一直往左转，可能永远发现不了右边有一个更大的宝藏。这就是强化学习最核心的难题——&lt;strong&gt;探索与利用的平衡&lt;/strong&gt;（exploration vs. exploitation）。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;利用&lt;/strong&gt;：走你已经知道能拿到奖励的路（稳定但不会进步）&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;探索&lt;/strong&gt;：尝试没走过的路（可能发现更好的，也可能踩坑）&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这在直觉上很简单：你总不能天天吃同一种菜吧？但AI没有&amp;quot;好奇心&amp;quot;这种情感，它需要一套数学机制来驱动&amp;quot;探索&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;早期的办法是&amp;quot;ε-greedy&amp;quot;策略：90%的时间走最优路径，10%的时间随机乱走。这就像你每周五天去最喜欢的餐厅，但留一天随机探店——万一发现更好的呢？&lt;/p&gt;&#xA;&lt;p&gt;但真正让强化学习变得强大的，是更聪明的探索方式。比如SAC算法（Soft Actor-Critic）的核心思想就是：&lt;strong&gt;AI不仅要学会完成任务，还要保持一定程度的&amp;quot;随机性&amp;quot;&lt;/strong&gt;——在完成任务和保持好奇心之间找平衡。它不追求&amp;quot;每一步都走对&amp;quot;，而是追求&amp;quot;即使走错一步，也不会全盘崩溃&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很反直觉，但事实是：一个太&amp;quot;确定&amp;quot;的AI往往很脆弱；一个会&amp;quot;适当犯傻&amp;quot;的AI，反而更聪明、更稳定。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;从小游戏到围棋大师alphago的秘密&#34;&gt;从小游戏到围棋大师——AlphaGo的秘密&lt;/h2&gt;&#xA;&lt;p&gt;说回AlphaGo。它之所以能击败李世石，不是因为它的&amp;quot;大脑&amp;quot;有多聪明，而是因为它学会了&amp;quot;思考&amp;quot;——不是人类的思考，而是一种叫&lt;strong&gt;蒙特卡洛树搜索&lt;/strong&gt;（MCTS）的技术。&lt;/p&gt;&#xA;&lt;p&gt;想象你在下围棋，每一步都有几十种选择。你不可能算到终局，但你可以&amp;quot;模拟&amp;quot;几个不同的下法，看看哪个结果更好。AlphaGo就是这么做的：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;直觉系统&lt;/strong&gt;（策略网络）：看一眼棋盘，就能快速判断哪些位置值得下、哪些不值得&lt;/li&gt;&#xA;&lt;li&gt;它有一个&lt;strong&gt;判断系统&lt;/strong&gt;（值网络）：对每个局面，能估算出胜率&lt;/li&gt;&#xA;&lt;li&gt;它把这两个系统结合起来，在脑海中模拟成千上万种可能的走法，然后选择&amp;quot;看起来最有可能赢&amp;quot;的那一步&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这种方法之所以强大，是因为它&lt;strong&gt;不是背棋谱&lt;/strong&gt;。AlphaGo的每一步决策，都是&amp;quot;实时计算&amp;quot;出来的——它在一个时间点可能选择A，但换一个局面，同样的位置它可能完全忽略。&lt;/p&gt;&#xA;&lt;p&gt;最终，AlphaGo通过三阶段训练完成了从零到大师的蜕变：先看人类棋谱学个大概（监督学习），再跟自己下棋自我提升（强化学习），最后学习评估局面好坏（值网络）。每一步都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中完成的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;为什么你的手机越来越懂你&#34;&gt;为什么你的手机越来越&amp;quot;懂你&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;强化学习不只是下围棋。它可能正在塑造你的日常生活，而你完全没意识到。&lt;/p&gt;&#xA;&lt;p&gt;抖音的推荐系统、淘宝的&amp;quot;猜你喜欢&amp;quot;、甚至你手机上的智能助手——它们都在使用强化学习的思想。每次你刷到一个视频看完，就是一次&amp;quot;奖励&amp;quot;信号；每次你划走，就是一次&amp;quot;惩罚&amp;quot;。系统在不断试错中学会什么内容能让你停留更久。&lt;/p&gt;&#xA;&lt;p&gt;更典型的例子是&lt;strong&gt;机器人走路&lt;/strong&gt;。你不能给机器人写一个&amp;quot;左脚迈30厘米，右脚迈35厘米，身体前倾15度&amp;quot;的精确程序——因为地面不平、重心变化、甚至电池电量都会影响结果。但你可以给它一个简单的目标信号：&amp;ldquo;往前走，别摔倒&amp;rdquo;。然后通过强化学习让它在数百万次跌倒中学会自己调整步态。&lt;/p&gt;&#xA;&lt;p&gt;这和我们人类学走路的方式一模一样——你小时候不是看了说明书才学会走路的，你是跌倒了无数次，在疼痛中学会了平衡。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;强化学习的边界它还不能做什么&#34;&gt;强化学习的边界——它还不能做什么&lt;/h2&gt;&#xA;&lt;p&gt;当然，强化学习不是万能的。&lt;/p&gt;&#xA;&lt;p&gt;首先，它&lt;strong&gt;效率不高&lt;/strong&gt;。AlphaGo跟自己下了几千万盘棋才达到大师水平。如果让一个AI学开车，让它先在真实道路上&amp;quot;试错&amp;quot;几百万次——那它得撞坏多少辆车？所以自动驾驶用的是模仿学习和模拟器，而不是纯强化学习。&lt;/p&gt;&#xA;&lt;p&gt;其次，它&lt;strong&gt;需要明确的奖励信号&lt;/strong&gt;。怎么定义&amp;quot;一篇好文章&amp;quot;的奖励？阅读量？点赞数？转发数？这些指标都很片面。在奖励模糊的场景中，强化学习容易学偏——比如一个AI为了追求&amp;quot;点赞最大化&amp;quot;，可能会生成标题党、煽动性内容，而不是真正有价值的信息。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;强化学习学到的&amp;quot;策略&amp;quot;，往往是黑箱&lt;/strong&gt;。AlphaGo下出了很多人类从未见过的&amp;quot;神之一手&amp;quot;，但没人能解释它为什么那么下。它是对的，但它是&amp;quot;蒙对的&amp;quot;还是&amp;quot;真懂的&amp;quot;？这是一个哲学问题，也是AI可解释性领域正在攻克的难题。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;三种学习方式的对比ai的学习观&#34;&gt;三种学习方式的对比——AI的&amp;quot;学习观&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;放在更大的框架下看，AI的三种学习方式就像三种不同的学习方法：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;监督学习&lt;/strong&gt;：像&amp;quot;刷题式学习&amp;quot;——给你大量题目和标准答案，直到你学会举一反三&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;无监督学习&lt;/strong&gt;：像&amp;quot;自学式学习&amp;quot;——给你一堆书，不管你看不看，你自己找规律&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;：像&amp;quot;实战式学习&amp;quot;——把你扔进真实战场，打输了就挨打，打赢了有奖励，你在血与火中学会生存&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三种方式各有优劣，没有哪一种&amp;quot;最好&amp;quot;。但强化学习有一种独特的魅力——它是最接近&amp;quot;生命学习&amp;quot;的方式。从细菌寻找食物，到婴儿学走路，到人类探索未知世界，本质上都是在&amp;quot;试错-反馈-调整&amp;quot;的循环中进化的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;结语学会失败的ai&#34;&gt;结语：学会&amp;quot;失败&amp;quot;的AI&lt;/h2&gt;&#xA;&lt;p&gt;强化学习教会我们一件事：&lt;strong&gt;失败不是终点，是数据&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;每一次错误的选择，每一次糟糕的决策，都在告诉AI&amp;quot;这条路行不通，换一条&amp;quot;。AlphaGo输给李世石的那一盘棋，不是&amp;quot;失败&amp;quot;，而是它学习路径上的一个梯度信号。&lt;/p&gt;&#xA;&lt;p&gt;也许这就是强化学习最迷人的地方——它不只是一种技术，更是一种哲学。它告诉我们，智能不是&amp;quot;知道正确答案&amp;quot;的能力，而是&amp;quot;从错误中学习&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;而AI之所以能变得比人类更聪明，不是因为它们不会犯错，而是因为它们&lt;strong&gt;不怕犯错&lt;/strong&gt;——它们可以在模拟器中失败一百万次，而不会感到沮丧。&lt;/p&gt;&#xA;&lt;p&gt;这一点，我们人类或许也该学学。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
