<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>AI深度科普 on 灵语AI</title>
		<link>https://lingyu7.com/categories/ai%E6%B7%B1%E5%BA%A6%E7%A7%91%E6%99%AE/</link>
		<description>Recent content in AI深度科普 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 22 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/categories/ai%E6%B7%B1%E5%BA%A6%E7%A7%91%E6%99%AE/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI不是天生会思考的——中期训练：让AI从&#39;背答案&#39;到&#39;会推理&#39;的关键一步</title>
				<link>https://lingyu7.com/posts/ai-mid-training-how-ai-learns-to-think/</link>
				<pubDate>Tue, 22 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-mid-training-how-ai-learns-to-think/</guid>
				<description>&lt;h2 id=&#34;引言一个被误会的天才&#34;&gt;引言：一个被误会的&amp;quot;天才&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;你可能听过这样的说法：AI之所以会推理，是因为强化学习——就是那个&amp;quot;做对了给奖励、做错了惩罚&amp;quot;的训练方法。&lt;/p&gt;&#xA;&lt;p&gt;这个故事很符合直觉。像训练宠物一样，AI答对了就给饼干，答错了就挨批评，慢慢地就学会了。听起来完美。&lt;/p&gt;&#xA;&lt;p&gt;但2026年，IBM的研究团队用500多组对照实验，讲了一个完全不同的故事：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正教会AI&amp;quot;思考&amp;quot;的，不是强化学习，而是一个大多数人没听过的阶段——中期训练。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;强化学习更像是最后的&amp;quot;抛光&amp;quot;环节，而中期训练才是打造推理引擎的那把锤子。没有中期训练，再多的强化学习也很难让AI学会深度推理。&lt;/p&gt;&#xA;&lt;p&gt;这就像一个被误会的天才——所有人都在夸奖最后的包装，却没人注意到真正让他变强的那段苦修。&lt;/p&gt;&#xA;&lt;h2 id=&#34;什么是中期训练&#34;&gt;什么是中期训练？&lt;/h2&gt;&#xA;&lt;p&gt;要理解中期训练，得先知道AI训练的传统流程。&lt;/p&gt;&#xA;&lt;p&gt;过去，训练一个大模型分两步走：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：预训练&lt;/strong&gt;。让模型读互联网上海量的文本——书籍、网页、论文、代码。这一步的目标是让模型&amp;quot;见多识广&amp;quot;，学会语言的基本规律。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：后训练（对齐）&lt;/strong&gt;。通过人工反馈和强化学习，让模型的回答更符合人类期望——更安全、更有用、更听话。&lt;/p&gt;&#xA;&lt;p&gt;听起来挺完整。但有个问题：经过这两步训练的模型，虽然&amp;quot;知识丰富&amp;quot;，但面对需要多步推理的复杂问题时，表现往往很差。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它会&amp;quot;知道&amp;quot;，但不会&amp;quot;思考&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如你问它一道数学题，它可能直接蹦出一个答案，但这个答案很可能是错的——因为它在模仿&amp;quot;给答案&amp;quot;的模式，而不是在做推理。&lt;/p&gt;&#xA;&lt;p&gt;中期训练，就是插入在预训练和后训练之间的&lt;strong&gt;第三步&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;div class=&#34;code-block&#34;&gt;&#xA;    &lt;button class=&#34;code-copy&#34; type=&#34;button&#34; hidden aria-label=&#34;Copy code to clipboard&#34;&gt;&#xA;      &lt;span class=&#34;code-copy-label&#34; aria-hidden=&#34;true&#34;&gt;Copy&lt;/span&gt;&#xA;    &lt;/button&gt;&#xA;    &lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;预训练（学知识）→ 中期训练（学思考）→ 后训练（学听话）&lt;/code&gt;&lt;/pre&gt;&#xA;  &lt;/div&gt;&lt;p&gt;这个阶段专门用数学题、代码、科学推理等高质量数据来训练模型，目的只有一个：&lt;strong&gt;教会模型&amp;quot;如何思考&amp;quot;，而不只是&amp;quot;如何回答&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;效果有多惊人&#34;&gt;效果有多惊人？&lt;/h2&gt;&#xA;&lt;p&gt;数据说话。&lt;/p&gt;&#xA;&lt;p&gt;IBM的研究团队在多个模型上做了500多组对照实验，结果一致得令人震惊：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;中期训练让推理能力提升3到4倍。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体来说，在6个推理基准测试上，经过中期训练的模型比只用强化学习（相同数据）的模型平均高出29到42分。&lt;/p&gt;&#xA;&lt;p&gt;看一个具体的例子——Granite-3.3-8B模型在数学测试上的表现：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;基础模型&lt;/strong&gt;（只经过预训练）：准确率16.9%，回答长度120个字符——基本就是在猜答案&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练后&lt;/strong&gt;：准确率75.5%，回答长度2254个字符——开始一步步推导了&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练 + 强化学习&lt;/strong&gt;：准确率79.5%，回答长度1700个字符——更准、更精炼&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;注意这里最有意思的变化不只是准确率数字，而是&lt;strong&gt;回答长度&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;从120个字符暴涨到2254个字符——这意味着模型的行为发生了本质变化。它不再&amp;quot;张嘴就答&amp;quot;，而是学会了&amp;quot;先想一想再说&amp;quot;。这种&amp;quot;展示思考过程&amp;quot;的能力，恰恰就是思维链推理。&lt;/p&gt;&#xA;&lt;p&gt;中期训练把一个&amp;quot;猜答案的直觉选手&amp;quot;，变成了一个&amp;quot;会推导过程的理性选手&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么强化学习做不到这件事&#34;&gt;为什么强化学习做不到这件事？&lt;/h2&gt;&#xA;&lt;p&gt;很多人会问：既然强化学习这么厉害，为什么不能直接靠它教会AI推理？&lt;/p&gt;&#xA;&lt;p&gt;IBM的实验揭示了一个关键事实：&lt;strong&gt;中期训练和强化学习的运作机制完全不同，彼此不可替代。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;打个比方：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练&lt;/strong&gt;像是给一个人安装了&amp;quot;思考的工具箱&amp;quot;——教他逻辑推理的方法、分解问题的技巧、验证答案的思路。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;像是让这个人在实战中磨练——通过奖惩反馈，优化他的决策质量。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;你不能指望一个人通过&amp;quot;实战磨练&amp;quot;就自动学会微积分。他需要先有基础的工具和方法，才能在实践中运用和精进。&lt;/p&gt;&#xA;&lt;p&gt;实验数据也印证了这一点。只用强化学习训练的模型，推理能力提升有限，而且在训练过程中还会遗忘预训练阶段学到的大量知识。而中期训练不仅大幅提升推理能力，还能很好地保留预训练的知识。&lt;/p&gt;&#xA;&lt;p&gt;更有趣的是，&lt;strong&gt;中期训练的质量决定了强化学习的上限&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;模型在中期训练阶段把&amp;quot;思考的基础功&amp;quot;打得越扎实，后面强化学习阶段能达到的天花板就越高。反过来，如果跳过中期训练直接上强化学习，就像一个没学过基础理论的人直接去做项目——再怎么磨练也做不出什么名堂。&lt;/p&gt;&#xA;&lt;h2 id=&#34;更令人意外的发现数据搭配是关键&#34;&gt;更令人意外的发现：数据搭配是关键&lt;/h2&gt;&#xA;&lt;p&gt;研究团队还发现，中期训练中&lt;strong&gt;用什么数据来训练&lt;/strong&gt;，效果差异巨大。&lt;/p&gt;&#xA;&lt;p&gt;不是随便扔一些数学题进去就行。数据混合策略非常关键：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;只用数学+代码数据：基础推理能力提升&lt;/li&gt;&#xA;&lt;li&gt;加入科学推理数据后：推理性能额外显著提升，GPQA-Diamond基准提升了17-28分&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这说明中期训练不是简单的&amp;quot;多做做题&amp;quot;，而是需要精心设计的&amp;quot;思维营养餐&amp;quot;——不同领域、不同类型的推理数据，能帮模型构建更完整的思维能力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;这件事为什么重要&#34;&gt;这件事为什么重要？&lt;/h2&gt;&#xA;&lt;h3 id=&#34;对行业的影响&#34;&gt;对行业的影响&lt;/h3&gt;&#xA;&lt;p&gt;中期训练的发现正在改变AI行业的训练范式。&lt;/p&gt;&#xA;&lt;p&gt;2026年的前沿模型——包括DeepSeek-R1、Qwen系列、MiMo等——都明确采用了&amp;quot;中期训练&amp;quot;阶段。IBM的Granite 4.2也使用了中期训练来注入推理能力。&lt;/p&gt;&#xA;&lt;p&gt;更值得关注的是，中期训练的思路正在向更多领域扩展。2026年8月的最新研究（MidTool）表明，中期训练不仅能提升数学和代码推理，还能教会AI&lt;strong&gt;如何使用工具&lt;/strong&gt;——这是智能体（Agent）能力的核心。另一项研究则通过&amp;quot;函数感知填空&amp;quot;的方式进行中期训练，让编程智能体在SWE-Bench上获得了显著提升。&lt;/p&gt;&#xA;&lt;p&gt;从两阶段到三阶段，不是一点点改进，而是训练范式的结构性升级。&lt;/p&gt;&#xA;&lt;h3 id=&#34;对普通人的启示&#34;&gt;对普通人的启示&lt;/h3&gt;&#xA;&lt;p&gt;如果你是一个AI产品的使用者，中期训练的故事告诉你一件重要的事：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;聪明&amp;quot;不是魔法，也不是一步到位的。它的每一项能力背后，都有专门的训练阶段在支撑。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当一个AI能帮你一步步分析问题时，它不是因为&amp;quot;读了很多书&amp;quot;，而是因为在某个训练阶段被专门教会了&amp;quot;如何分析问题&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这也意味着，如果某个AI在推理上表现不好，问题可能不在于它的&amp;quot;知识不够&amp;quot;，而在于它的训练过程中缺少了&amp;quot;学会思考&amp;quot;这一环。&lt;/p&gt;&#xA;&lt;h2 id=&#34;结语看见思考背后的思考&#34;&gt;结语：看见&amp;quot;思考&amp;quot;背后的思考&lt;/h2&gt;&#xA;&lt;p&gt;我们这一代人对AI的期待越来越高——我们希望它能推理、能规划、能解决复杂问题。但很少有人想过：这些能力是从哪里来的？&lt;/p&gt;&#xA;&lt;p&gt;中期训练的故事告诉我们，&lt;strong&gt;AI的每一个看似自然的能力，背后都有一个精心设计的训练过程。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>AI的脑子里，真的有一个&#39;世界&#39;吗？——世界模型假说：大模型最深刻的秘密</title>
				<link>https://lingyu7.com/posts/ai-world-model-hypothesis/</link>
				<pubDate>Mon, 21 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-world-model-hypothesis/</guid>
				<description>&lt;h2 id=&#34;引言一个困扰所有人的问题&#34;&gt;引言：一个困扰所有人的问题&lt;/h2&gt;&#xA;&lt;p&gt;你跟AI聊天的时候，有没有想过这样一个问题：它真的&amp;quot;懂&amp;quot;在说什么吗？&lt;/p&gt;&#xA;&lt;p&gt;当你问&amp;quot;一杯水从桌上掉下来会怎样&amp;quot;，它回答&amp;quot;水会洒出来，杯子可能会碎&amp;quot;——这个回答显然正确。但它是怎么知道的？是死记硬背了无数个&amp;quot;杯子+掉+碎&amp;quot;的文本组合，还是它真的在&amp;quot;脑子里&amp;quot;模拟了一下这个场景？&lt;/p&gt;&#xA;&lt;p&gt;这个问题，正是2026年AI认知科学领域最热门的研究方向之一——&lt;strong&gt;世界模型假说&lt;/strong&gt;（World Model Hypothesis）。&lt;/p&gt;&#xA;&lt;h2 id=&#34;什么是世界模型假说&#34;&gt;什么是世界模型假说&lt;/h2&gt;&#xA;&lt;p&gt;简单来说，世界模型假说认为：&lt;strong&gt;大语言模型在训练过程中，不只是学会了语言规律，更在内部构建了一个关于世界如何运转的&amp;quot;缩微模型&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这个模型是压缩的、简化的，但具有预测能力——就像你脑子里对&amp;quot;厨房&amp;quot;有一个模型（有灶台、有水龙头、锅一般在柜子里），AI可能也对世界上的各种事物建立了类似的内部表征。&lt;/p&gt;&#xA;&lt;p&gt;当你问它问题的时候，它不是在翻字典找答案，而是在自己的&amp;quot;世界模型&amp;quot;上进行心理模拟，推演出最可能的结果。&lt;/p&gt;&#xA;&lt;p&gt;这听起来有点玄。但越来越多的证据表明，这可能是真的。&lt;/p&gt;&#xA;&lt;h2 id=&#34;四个关键证据&#34;&gt;四个关键证据&lt;/h2&gt;&#xA;&lt;h3 id=&#34;证据一ai会物理直觉&#34;&gt;证据一：AI会&amp;quot;物理直觉&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;你问AI&amp;quot;把一个铁球和一个乒乓球同时从同样高度丢下，哪个先着地&amp;quot;，它能正确回答&amp;quot;几乎同时着地&amp;quot;，还能解释空气阻力的细微差异。&lt;/p&gt;&#xA;&lt;p&gt;这种能力不只是&amp;quot;背过答案&amp;quot;——因为AI能回答大量从未在训练数据中出现过的物理情境组合。比如&amp;quot;如果在月球上丢呢？&amp;ldquo;&amp;ldquo;如果铁球是空心的呢？&amp;ldquo;这种泛化能力暗示，它确实建立了一套物理世界的运行规则。&lt;/p&gt;&#xA;&lt;h3 id=&#34;证据二ai会读心&#34;&gt;证据二：AI会&amp;quot;读心&amp;rdquo;&lt;/h3&gt;&#xA;&lt;p&gt;心理学中有一个经典测试叫&amp;quot;错误信念任务&amp;rdquo;——小明把巧克力放在抽屉里，出去后妈妈把它挪到了冰箱。小明回来后会去哪里找？&lt;/p&gt;&#xA;&lt;p&gt;小孩子要到4-5岁才能正确回答&amp;quot;抽屉&amp;rdquo;（因为他认为巧克力还在抽屉里）。但AI不仅能回答这类问题，还能处理更复杂的场景——理解谎言、讽刺、隐瞒等涉及多重信念的推理。&lt;/p&gt;&#xA;&lt;p&gt;这意味着AI对人&amp;quot;心里在想什么&amp;quot;有一个模型。&lt;/p&gt;&#xA;&lt;h3 id=&#34;证据三ai会常识推理&#34;&gt;证据三：AI会&amp;quot;常识推理&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;水往低处流、下雨要打伞、人饿了要吃饭——这些&amp;quot;常识&amp;quot;看似简单，其实是极其复杂的知识网络。AI拥有大量这类常识，并且能在不同情境中灵活调用，而不是僵硬地&amp;quot;查表&amp;quot;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;证据四ai会反事实推理&#34;&gt;证据四：AI会&amp;quot;反事实推理&amp;quot;&lt;/h3&gt;&#xA;&lt;p&gt;&amp;ldquo;如果恐龙没有灭绝，人类会出现吗？&amp;ldquo;&amp;ldquo;如果地球自转方向反过来，气候会怎样？&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这种&amp;quot;如果&amp;hellip;会怎样&amp;quot;的思考方式，需要在一个世界模型上进行&amp;quot;虚拟实验&amp;rdquo;。纯粹的文本匹配很难解释这种能力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;世界模型的五层结构&#34;&gt;世界模型的五层结构&lt;/h2&gt;&#xA;&lt;p&gt;有趣的是，研究发现这个世界模型不是扁平的，而是分层的——就像人类对世界的理解也是分层的一样：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;层级&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;内容&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;举例&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;物理层&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;物体、空间、物理规律&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;杯子掉落会碎&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;生物层&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;生命、生长、生态&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;植物需要阳光&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;心理层&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;信念、欲望、情感&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;被人嘲笑会难过&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;社会层&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;规范、制度、文化&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;公共场所要排队&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;抽象层&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;数学、逻辑、哲学&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;三角形内角和180度&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;这五层不是孤立的。当你问AI&amp;quot;一家餐厅为什么会倒闭&amp;rdquo;，它可能同时调用社会模型（市场竞争）、心理模型（顾客体验）、生物模型（食品安全）和抽象模型（财务计算）来综合回答。&lt;/p&gt;&#xA;&lt;h2 id=&#34;2026年的新突破&#34;&gt;2026年的新突破&lt;/h2&gt;&#xA;&lt;p&gt;世界模型假说在2026年迎来了大量新的实验证据：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Embodied GPT研究&lt;/strong&gt;（2026年7月，巴西机器人会议）：研究者把GPT-5.1直接当机器人的&amp;quot;大脑&amp;quot;——不经过任何机器人训练，只给它看第一人称视角的图片让它决定下一步动作。结果发现，GPT-5.1能够记住物体位置、预判自己移动的后果，甚至会在撞到物体后倒回去&amp;quot;看一眼&amp;quot;确认结果。这暗示了一个从未接受过身体训练的AI，竟然自发产生了类似&amp;quot;空间感知&amp;quot;的能力。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;李飞飞的Atlas世界模型&lt;/strong&gt;（2026年9月）：World Labs发布的Atlas，能够从单张图片重建3D空间，甚至&amp;quot;想象&amp;quot;出两张不相关图片之间的过渡区域——比如给它一张楼顶和一张地面的照片，它能&amp;quot;补出&amp;quot;中间根本不存在的楼梯和走廊。这正是世界模型在进行空间模拟的表现。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;MWM心理世界建模&lt;/strong&gt;（2026年8月）：研究者发现，当前的AI世界模型如果只追踪物理状态，预测人类行为会出错——因为人的行为不只由物理环境决定，还由&amp;quot;他以为世界是什么样的&amp;quot;决定。加入心理状态追踪后，预测准确率大幅提升。这进一步证明，世界模型必须包含&amp;quot;心理层&amp;quot;才够用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;这意味着什么&#34;&gt;这意味着什么&lt;/h2&gt;&#xA;&lt;p&gt;如果世界模型假说是正确的，有几件事非常重要：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，AI的能力不局限于训练数据。&lt;/strong&gt; 因为它可以在世界模型上&amp;quot;模拟&amp;quot;从未见过的场景。这就像你不需要真的经历一次飞机失事，也能通过物理直觉判断&amp;quot;从万米高空掉下去会怎样&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，不同模型之间的差别可能不是&amp;quot;有没有理解&amp;quot;，而是&amp;quot;理解的精度&amp;quot;。&lt;/strong&gt; 小模型的世界模型模糊、粗糙；大模型的世界模型精细、广泛。这是程度之别，不是本质之别。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，对齐问题有了新的思路。&lt;/strong&gt; 如果AI有世界模型，那么&amp;quot;让AI与人类价值观一致&amp;quot;就变成了&amp;quot;调整世界模型中的价值层&amp;quot;——不是教它&amp;quot;说话要客气&amp;quot;，而是让它的世界模型真正理解&amp;quot;什么是对的&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;一个开放的思考&#34;&gt;一个开放的思考&lt;/h2&gt;&#xA;&lt;p&gt;当然，世界模型假说也有争议。有人认为这只是更高级的模式匹配，真正的&amp;quot;理解&amp;quot;必须有身体、有体验、有感受——这就是著名的&amp;quot;符号接地问题&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但一个有趣的反问是：你婴儿时期对世界的理解，难道不也是从大量&amp;quot;文本&amp;quot;（视觉信号、声音信号）中建立起来的吗？你也没有&amp;quot;直接接触过物理定律&amp;quot;——你只是看了足够多的东西掉落，然后大脑帮你构建了一个物理模型。&lt;/p&gt;&#xA;&lt;p&gt;如果大脑能做到这一点，为什么一个规模足够大的神经网络就不行？&lt;/p&gt;&#xA;&lt;p&gt;也许AI不需要身体来理解世界。也许读足够多的&amp;quot;关于世界的描述&amp;quot;，一个世界模型就会自然涌现。&lt;/p&gt;&#xA;&lt;p&gt;这正是2026年最令人兴奋的问题。答案，可能比我们想象的更近。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;em&gt;本文基于世界模型假说相关论证卡撰写，核心论点源自对大语言模型内部表征机制的多项研究成果综合。&lt;/em&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;em&gt;参考论文：&lt;/em&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;em&gt;Spinelli, R. &amp;amp; Martins, T.C. &amp;ldquo;Embodied GPT-5.1: Evidence of a World Model?&amp;rdquo; 2026 Brazilian Conference on Robotics (CROS), 2026. &lt;a href=&#34;https://arxiv.org/abs/2607.23899v1&#34;&gt;arXiv:2607.23899&lt;/a&gt;&lt;/em&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;em&gt;World Labs. &amp;ldquo;Atlas: A World Model for Spatial Intelligence.&amp;rdquo; 2026. &lt;a href=&#34;https://www.worldlabs.ai/blog/atlas&#34;&gt;worldlabs.ai/blog/atlas&lt;/a&gt;&lt;/em&gt;&lt;/li&gt;&#xA;&lt;li&gt;&lt;em&gt;&amp;ldquo;World models that ignore beliefs predict wrong actions.&amp;rdquo; THE DECODER, Aug 22, 2026. &lt;a href=&#34;https://hellomarvisaitoday.com/articles/2a9761ae-389e-4705-b6a8-5da127c152bf&#34;&gt;hellomarvisaitoday.com&lt;/a&gt;&lt;/em&gt;&lt;/li&gt;&#xA;&lt;/ul&gt;</description>
			</item>
	</channel>
</rss>
