引言

2026年9月29日,AMD宣布以82亿美元收购李飞飞创办的World Labs。几乎同一时间,Yann LeCun参与的AMI公司也完成了近10亿美元融资。Dealroom数据显示,2026年世界模型赛道融资总额已超过32亿美元,比去年全年还多。

一个让很多人困惑的问题浮出水面:世界模型到底是什么?为什么资本愿意砸这么多钱?

这篇文章,我想从一个更深的视角来聊聊这件事——不是简单的行业资讯搬运,而是试图回答一个更根本的问题:AI为什么需要"理解世界",以及这条路径为什么可能是通向真正智能的关键。

从"语言天才"到"物理白痴":AI遇到了天花板

过去几年,大语言模型展示了惊人的语言能力——写文章、编代码、做翻译,样样不在话下。但如果你让一个最先进的语言模型回答"一个杯子从桌子边缘掉下去会发生什么",它可能会给出一个看似合理但经不起推敲的答案。

这不是模型"不聪明",而是它学习方式的根本局限。

语言模型本质上是在学习符号与符号之间的统计关系。它知道"杯子"和"掉落"经常一起出现,知道"碎"和"地板"有很强的共现关系。但它从未"见过"一个杯子真的掉下去——它没有重力、碰撞、摩擦的直观经验。

认知科学家Stevan Harnad在1990年就提出了这个著名的**“符号接地问题”**:一个纯符号系统,如何能真正理解符号的意义?就像一个人在字典里查词,每个定义都是用其他词写的,翻来翻去都在符号圈子里打转,永远跳不出去。

人类的突破口是感官经验——我们见过真实的杯子、感受过重力的拉扯、听过碎裂的声音。这些非符号的感知经验,为符号提供了"接地"的基础。

世界模型,正是AI试图跨越这条鸿沟的一次努力。

世界模型:AI脑中的"物理沙盘"

简单说,世界模型是AI在内部构建的一个关于世界如何运转的"模拟沙盘"。

你闭上眼睛,想象一个杯子被推到桌子边缘——你的大脑会自动"看到"它失去支撑后掉落的画面。你没有真的去做实验,是你的大脑在用一个内部的"世界模型"做模拟。

认知神经科学中有一个影响深远的预测编码理论:大脑不是被动接收信息,而是不断主动预测世界接下来会发生什么,然后用实际感受到的信息来修正预测。感知本身就是一个"预测→误差→修正"的循环。

世界模型的思路与此如出一辙——让AI不只是处理当前的输入,而是在内部构建一个可以推演"如果我做某个动作,世界会怎么变化"的模型。

2026年的产业界,世界模型已经分化出三条主要技术路线:

路线一:预测视频流。给模型当前的画面和一个动作指令,让它"画出"接下来会发生什么。小鹏的X-World、Google的Genie都属于这条路线。就像给自动驾驶系统一个虚拟的"想象力"——变道前先在脑中模拟一下变道后的画面。

路线二:提取抽象状态。Yann LeCun主推的JEPA架构,不追求生成逼真的像素画面,而是抓住重点——杯子被推离桌面支撑后大概率会下降。至于杯子表面的反光和桌面的花纹,不重要。这条路线更像一个"物理学直觉引擎"。

路线三:重建空间结构。李飞飞的World Labs走的正是这条路。输入一张图片或一段文字,直接构建出一个可以走进去、转视角、交互探索的三维世界。从去年的Marble到今年9月发布的Atlas,World Labs已经能够用手机拍摄一段视频,然后生成一个机器人可以在其中导航的三维仿真环境。

为什么是现在?三个推动力

世界模型的概念并不新。为什么2026年突然爆了?

第一,大语言模型的能力天花板倒逼新范式。 语言模型可以做到很多事,但涉及物理推理、空间理解、因果推演时就明显力不从心。业界逐渐意识到,仅靠语言数据训练出来的智能是不够的。

第二,具身智能需求爆发。 人形机器人、自动驾驶等产业需要AI在真实物理世界中行动。在真实环境中反复试错成本太高——机器人摔一跤可能损坏几十万的硬件,自动驾驶出一次事故可能造成人员伤亡。世界模型提供的虚拟仿真场,让所有训练和试错都在算力集群上完成。

第三,基础技术成熟。 视频生成模型、3D重建技术(NeRF、3D高斯溅射)、大规模算力基础设施都在近两年取得重大突破,让世界模型从理论原型变成了可工程化的产品。

不只是技术——一个关于"理解"的哲学问题

世界模型的意义远超一个技术方向。它触及了一个深刻的哲学问题:什么是"理解"?

当一个AI可以在内部模拟物理世界的运行规律,可以预测一个动作的后果,可以在"脑中的沙盘"上推演各种可能性——我们是否可以认为,它在某种程度上"理解"了这个世界?

认知科学中有一个世界模型假说:大语言模型在训练中不只是学习语言模式,而是在构建一个关于世界的内部模型——一个压缩的、简化的、但具有预测能力的世界表征。这个模型涵盖物理、生物、心理、社会、抽象等多个层次。

如果这个假说成立,那LLM的很多"不可思议"的能力就有了统一的解释——为什么它能做物理推理(物理世界模型)、理解人的意图(心理世界模型)、回答反事实问题(在世界模型上做模拟)。

而世界模型的研究方向,本质上是在将这个隐含的、不完整的内部模型,变成一个显式的、精确的、可以直接操作的工具。

这也许是通向"真正理解"的一条路径——不是通过更多的文字,而是通过在内部建立一个可以运转的世界。

冷静一下:争议与挑战

当然,世界模型并非没有争议。

定义还没对齐。 连业内自己都没搞清楚"世界模型"到底指什么。做视频生成的说是世界模型,做3D重建的说是世界模型,做强化学习环境的也说是世界模型。三个方向各玩各的,效果参差不齐。

效果和宣传有差距。 World Labs的Marble开放后,不少体验者反馈"画面卡顿、画质粗糙",体验"不如打开一款3A游戏"。世界模型目前能生成的场景还比较基础,距离真正可用的工业级仿真还有不小的距离。

算力需求可能是个无底洞。 世界模型需要处理海量的空间数据和物理模拟,对算力的需求可能比当前的大语言模型还高得多。这也是AMD收购World Labs的深层逻辑——模型公司和芯片公司需要深度绑定。

Sim2Real鸿沟依然存在。 在虚拟仿真中训练出来的能力,能否真正迁移到现实世界的物理设备上,仍然是一个未解决的难题。仿真环境再逼真,和真实物理世界之间总有差距。

写在最后

李飞飞在AMD收购公告当天发了一篇博客,引用了《尤利西斯》中的一句话:

“来吧,我的朋友们,现在去寻找一个新世界还不算晚。”

这句话既是对技术团队的激励,也像是在对整个AI行业说:语言智能的故事已经讲了一半,下一个章节是关于物理世界的。

从认知科学的预测编码理论,到工程化的三维世界仿真;从让机器人学会抓取杯子,到让自动驾驶预判变道后的路况——世界模型正在尝试做一件人类花了数百万年才做到的事:在头脑中构建一个世界,然后在其中推演未来。

这条路还很长,82亿美元可能只是一个起点。但方向已经清晰了:AI的下一站,不是更多文字,而是一个更好的"世界"。


参考来源:

  1. 世界模型假说 — 基于认知科学与AI交叉领域的理论框架,论述LLM内部世界表征的多层结构
  2. 符号接地问题(Harnad, 1990)— 认知科学经典问题,探讨纯符号系统如何获得真正的语义理解
  3. 预测编码理论(Rao & Ballard, 1999; Friston, 2005)— 认知神经科学中关于大脑预测-误差最小化机制的核心理论
  4. AMD收购World Labs公告 — 2026年9月29日,交易对价约82亿美元
  5. 亿欧智库《2026世界模型行业研究报告》— 世界模型技术谱系与产业格局分析
  6. World Labs Atlas发布 — 2026年9月,新一代三维世界模型,支持机器人导航仿真
  7. Dealroom 2026年中统计 — 世界模型初创企业2026年融资总额超32亿美元