<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>空间智能 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E7%A9%BA%E9%97%B4%E6%99%BA%E8%83%BD/</link>
		<description>Recent content in 空间智能 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Fri, 02 Oct 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E7%A9%BA%E9%97%B4%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AMD豪掷82亿美元买下的&#39;世界模型&#39;，到底在买什么？</title>
				<link>https://lingyu7.com/posts/world-model-amd-82-billion-what-are-world-models/</link>
				<pubDate>Fri, 02 Oct 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/world-model-amd-82-billion-what-are-world-models/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;2026年9月29日，AMD宣布以82亿美元收购李飞飞创办的World Labs。几乎同一时间，Yann LeCun参与的AMI公司也完成了近10亿美元融资。Dealroom数据显示，2026年世界模型赛道融资总额已超过32亿美元，比去年全年还多。&lt;/p&gt;&#xA;&lt;p&gt;一个让很多人困惑的问题浮出水面：世界模型到底是什么？为什么资本愿意砸这么多钱？&lt;/p&gt;&#xA;&lt;p&gt;这篇文章，我想从一个更深的视角来聊聊这件事——不是简单的行业资讯搬运，而是试图回答一个更根本的问题：&lt;strong&gt;AI为什么需要&amp;quot;理解世界&amp;quot;，以及这条路径为什么可能是通向真正智能的关键。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;从语言天才到物理白痴ai遇到了天花板&#34;&gt;从&amp;quot;语言天才&amp;quot;到&amp;quot;物理白痴&amp;quot;：AI遇到了天花板&lt;/h2&gt;&#xA;&lt;p&gt;过去几年，大语言模型展示了惊人的语言能力——写文章、编代码、做翻译，样样不在话下。但如果你让一个最先进的语言模型回答&amp;quot;一个杯子从桌子边缘掉下去会发生什么&amp;quot;，它可能会给出一个看似合理但经不起推敲的答案。&lt;/p&gt;&#xA;&lt;p&gt;这不是模型&amp;quot;不聪明&amp;quot;，而是它学习方式的根本局限。&lt;/p&gt;&#xA;&lt;p&gt;语言模型本质上是在学习符号与符号之间的统计关系。它知道&amp;quot;杯子&amp;quot;和&amp;quot;掉落&amp;quot;经常一起出现，知道&amp;quot;碎&amp;quot;和&amp;quot;地板&amp;quot;有很强的共现关系。但它从未&amp;quot;见过&amp;quot;一个杯子真的掉下去——它没有重力、碰撞、摩擦的直观经验。&lt;/p&gt;&#xA;&lt;p&gt;认知科学家Stevan Harnad在1990年就提出了这个著名的**&amp;ldquo;符号接地问题&amp;rdquo;**：一个纯符号系统，如何能真正理解符号的意义？就像一个人在字典里查词，每个定义都是用其他词写的，翻来翻去都在符号圈子里打转，永远跳不出去。&lt;/p&gt;&#xA;&lt;p&gt;人类的突破口是感官经验——我们见过真实的杯子、感受过重力的拉扯、听过碎裂的声音。这些非符号的感知经验，为符号提供了&amp;quot;接地&amp;quot;的基础。&lt;/p&gt;&#xA;&lt;p&gt;世界模型，正是AI试图跨越这条鸿沟的一次努力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;世界模型ai脑中的物理沙盘&#34;&gt;世界模型：AI脑中的&amp;quot;物理沙盘&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;简单说，&lt;strong&gt;世界模型是AI在内部构建的一个关于世界如何运转的&amp;quot;模拟沙盘&amp;quot;&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;你闭上眼睛，想象一个杯子被推到桌子边缘——你的大脑会自动&amp;quot;看到&amp;quot;它失去支撑后掉落的画面。你没有真的去做实验，是你的大脑在用一个内部的&amp;quot;世界模型&amp;quot;做模拟。&lt;/p&gt;&#xA;&lt;p&gt;认知神经科学中有一个影响深远的&lt;strong&gt;预测编码理论&lt;/strong&gt;：大脑不是被动接收信息，而是不断主动预测世界接下来会发生什么，然后用实际感受到的信息来修正预测。感知本身就是一个&amp;quot;预测→误差→修正&amp;quot;的循环。&lt;/p&gt;&#xA;&lt;p&gt;世界模型的思路与此如出一辙——让AI不只是处理当前的输入，而是在内部构建一个可以推演&amp;quot;如果我做某个动作，世界会怎么变化&amp;quot;的模型。&lt;/p&gt;&#xA;&lt;p&gt;2026年的产业界，世界模型已经分化出三条主要技术路线：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;路线一：预测视频流&lt;/strong&gt;。给模型当前的画面和一个动作指令，让它&amp;quot;画出&amp;quot;接下来会发生什么。小鹏的X-World、Google的Genie都属于这条路线。就像给自动驾驶系统一个虚拟的&amp;quot;想象力&amp;quot;——变道前先在脑中模拟一下变道后的画面。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;路线二：提取抽象状态&lt;/strong&gt;。Yann LeCun主推的JEPA架构，不追求生成逼真的像素画面，而是抓住重点——杯子被推离桌面支撑后大概率会下降。至于杯子表面的反光和桌面的花纹，不重要。这条路线更像一个&amp;quot;物理学直觉引擎&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;路线三：重建空间结构&lt;/strong&gt;。李飞飞的World Labs走的正是这条路。输入一张图片或一段文字，直接构建出一个可以走进去、转视角、交互探索的三维世界。从去年的Marble到今年9月发布的Atlas，World Labs已经能够用手机拍摄一段视频，然后生成一个机器人可以在其中导航的三维仿真环境。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么是现在三个推动力&#34;&gt;为什么是现在？三个推动力&lt;/h2&gt;&#xA;&lt;p&gt;世界模型的概念并不新。为什么2026年突然爆了？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一，大语言模型的能力天花板倒逼新范式。&lt;/strong&gt; 语言模型可以做到很多事，但涉及物理推理、空间理解、因果推演时就明显力不从心。业界逐渐意识到，仅靠语言数据训练出来的智能是不够的。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二，具身智能需求爆发。&lt;/strong&gt; 人形机器人、自动驾驶等产业需要AI在真实物理世界中行动。在真实环境中反复试错成本太高——机器人摔一跤可能损坏几十万的硬件，自动驾驶出一次事故可能造成人员伤亡。世界模型提供的虚拟仿真场，让所有训练和试错都在算力集群上完成。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三，基础技术成熟。&lt;/strong&gt; 视频生成模型、3D重建技术（NeRF、3D高斯溅射）、大规模算力基础设施都在近两年取得重大突破，让世界模型从理论原型变成了可工程化的产品。&lt;/p&gt;&#xA;&lt;h2 id=&#34;不只是技术一个关于理解的哲学问题&#34;&gt;不只是技术——一个关于&amp;quot;理解&amp;quot;的哲学问题&lt;/h2&gt;&#xA;&lt;p&gt;世界模型的意义远超一个技术方向。它触及了一个深刻的哲学问题：&lt;strong&gt;什么是&amp;quot;理解&amp;quot;？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当一个AI可以在内部模拟物理世界的运行规律，可以预测一个动作的后果，可以在&amp;quot;脑中的沙盘&amp;quot;上推演各种可能性——我们是否可以认为，它在某种程度上&amp;quot;理解&amp;quot;了这个世界？&lt;/p&gt;&#xA;&lt;p&gt;认知科学中有一个&lt;strong&gt;世界模型假说&lt;/strong&gt;：大语言模型在训练中不只是学习语言模式，而是在构建一个关于世界的内部模型——一个压缩的、简化的、但具有预测能力的世界表征。这个模型涵盖物理、生物、心理、社会、抽象等多个层次。&lt;/p&gt;&#xA;&lt;p&gt;如果这个假说成立，那LLM的很多&amp;quot;不可思议&amp;quot;的能力就有了统一的解释——为什么它能做物理推理（物理世界模型）、理解人的意图（心理世界模型）、回答反事实问题（在世界模型上做模拟）。&lt;/p&gt;&#xA;&lt;p&gt;而世界模型的研究方向，本质上是在将这个隐含的、不完整的内部模型，变成一个显式的、精确的、可以直接操作的工具。&lt;/p&gt;&#xA;&lt;p&gt;这也许是通向&amp;quot;真正理解&amp;quot;的一条路径——不是通过更多的文字，而是通过在内部建立一个可以运转的世界。&lt;/p&gt;&#xA;&lt;h2 id=&#34;冷静一下争议与挑战&#34;&gt;冷静一下：争议与挑战&lt;/h2&gt;&#xA;&lt;p&gt;当然，世界模型并非没有争议。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;定义还没对齐。&lt;/strong&gt; 连业内自己都没搞清楚&amp;quot;世界模型&amp;quot;到底指什么。做视频生成的说是世界模型，做3D重建的说是世界模型，做强化学习环境的也说是世界模型。三个方向各玩各的，效果参差不齐。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;效果和宣传有差距。&lt;/strong&gt; World Labs的Marble开放后，不少体验者反馈&amp;quot;画面卡顿、画质粗糙&amp;quot;，体验&amp;quot;不如打开一款3A游戏&amp;quot;。世界模型目前能生成的场景还比较基础，距离真正可用的工业级仿真还有不小的距离。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;算力需求可能是个无底洞。&lt;/strong&gt; 世界模型需要处理海量的空间数据和物理模拟，对算力的需求可能比当前的大语言模型还高得多。这也是AMD收购World Labs的深层逻辑——模型公司和芯片公司需要深度绑定。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;Sim2Real鸿沟依然存在。&lt;/strong&gt; 在虚拟仿真中训练出来的能力，能否真正迁移到现实世界的物理设备上，仍然是一个未解决的难题。仿真环境再逼真，和真实物理世界之间总有差距。&lt;/p&gt;&#xA;&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;&#xA;&lt;p&gt;李飞飞在AMD收购公告当天发了一篇博客，引用了《尤利西斯》中的一句话：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&amp;ldquo;来吧，我的朋友们，现在去寻找一个新世界还不算晚。&amp;rdquo;&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;这句话既是对技术团队的激励，也像是在对整个AI行业说：语言智能的故事已经讲了一半，下一个章节是关于物理世界的。&lt;/p&gt;&#xA;&lt;p&gt;从认知科学的预测编码理论，到工程化的三维世界仿真；从让机器人学会抓取杯子，到让自动驾驶预判变道后的路况——世界模型正在尝试做一件人类花了数百万年才做到的事：&lt;strong&gt;在头脑中构建一个世界，然后在其中推演未来。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这条路还很长，82亿美元可能只是一个起点。但方向已经清晰了：AI的下一站，不是更多文字，而是一个更好的&amp;quot;世界&amp;quot;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考来源：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;世界模型假说 — 基于认知科学与AI交叉领域的理论框架，论述LLM内部世界表征的多层结构&lt;/li&gt;&#xA;&lt;li&gt;符号接地问题（Harnad, 1990）— 认知科学经典问题，探讨纯符号系统如何获得真正的语义理解&lt;/li&gt;&#xA;&lt;li&gt;预测编码理论（Rao &amp;amp; Ballard, 1999; Friston, 2005）— 认知神经科学中关于大脑预测-误差最小化机制的核心理论&lt;/li&gt;&#xA;&lt;li&gt;AMD收购World Labs公告 — 2026年9月29日，交易对价约82亿美元&lt;/li&gt;&#xA;&lt;li&gt;亿欧智库《2026世界模型行业研究报告》— 世界模型技术谱系与产业格局分析&lt;/li&gt;&#xA;&lt;li&gt;World Labs Atlas发布 — 2026年9月，新一代三维世界模型，支持机器人导航仿真&lt;/li&gt;&#xA;&lt;li&gt;Dealroom 2026年中统计 — 世界模型初创企业2026年融资总额超32亿美元&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
