引言

2026年3月,一个消息在AI圈炸开了锅:Yann LeCun——深度学习三巨头之一、图灵奖得主——离开了待了12年的Meta,创办了一家叫AMI Labs的公司,种子轮融了10.3亿美元,估值35亿。

投资人阵容堪称豪华:Nvidia、三星、淡马锡、丰田、贝索斯……

但最让人好奇的不是钱,而是LeCun要拿这些钱去做什么。

他的答案只有三个字:世界模型。

而且他在多个场合反复强调一句话:“语言模型永远到不了AGI。”

这话从一个图灵奖得主嘴里说出来,分量不轻。他到底在赌什么?世界模型又是什么?今天我们就来聊清楚这件事。

一、为什么"猜下一个词"永远不够?

要理解世界模型,先要搞明白一个问题:LeCun为什么觉得LLM这条路走不通?

其实他的论证非常直觉。

LLM的核心能力是"预测下一个词"。给它一段文字,它根据训练中学到的统计规律,猜测后面最可能跟什么词。这个能力在文本领域极其强大,因为文本是离散的——词汇表是有限的(比如10万个token),所以模型可以对每一种可能性打分,输出一个概率分布。

但现实世界不是离散的。

LeCun举了一个非常生动的例子:假设你拍了一段房间的视频,镜头慢慢扫过去,然后停住。你让AI预测下一帧画面会是什么。

AI可以猜到大致的东西——这是一个房间,有人坐在桌前。但它不可能预测出每个人脸上具体的表情、地毯的纹理、吊灯上的反光。因为现实世界中,我们观察到的大部分细节,本质上就是不可预测的。

你可以预测关上门窗后加热空气,温度和压强会怎么变——因为有PV=nRT。但你不可能预测每一个空气分子的运动轨迹。分子太多了,根本算不过来。

这就是LLM路线在真实世界遇到的根本困难:如果你硬逼模型去预测所有细节,唯一的办法是给它塞一个"潜变量"来补充信息。但这个潜变量最后往往会承载绝大部分预测所需的信息,于是整个预测就变成了"复读"——模型并没有真正理解什么,只是把输入搬到了输出。

换句话说:LLM擅长在离散符号的世界里做推理,但真实世界是连续的、高维的、充满不确定性的。用"猜下一个词"的方式去理解世界,就像用计算器去画油画——工具本身就不对路。

二、世界模型到底是什么?

好了,问题清楚了。那世界模型又是什么?

一句话版本:世界模型就是一个AI内部的"物理引擎"——它不重建世界的每一个细节,而是学到世界的"骨架",然后用这个骨架去预测、规划和行动。

让我用一个更生活化的比喻来解释。

想象你正在学开车。开了一个月之后,你不需要每一步都"计算"——前面有红灯就踩刹车,变道前先看后视镜,下雨天减速。你的大脑里已经形成了一个关于"交通世界"的内在模型。这个模型不是对每一帧视觉画面的精确复刻,而是一个抽象的、抓重点的理解。

你知道"红灯→停车"这个因果关系,不需要记住每一个路口的红灯长什么样。

世界模型就是AI版本的这种"内在理解"。

具体来说,一个好的世界模型应该能做到三件事:

  1. 抽象表示:从海量的感官输入(图像、声音、传感器数据)中提取出真正重要的结构,忽略无关细节。就像你开车时不会去注意路边的广告牌内容,但会注意到前方车辆是否在减速。

  2. 预测未来:给定当前状态和一个动作,预测世界会变成什么样。“如果我打方向盘向左,车会怎么动?"——你的大脑可以在不真正执行动作的情况下"模拟"出结果。

  3. 支持规划:有了预测能力,AI就可以在脑中"试错”——先模拟10种可能的行动方案,选出最好的那个再去执行。这比直接随机尝试要高效得多。

这三点加在一起,就是LeCun眼中AI通向真正智能的路径。

三、JEPA:LeCun的药方

LeCun不仅在批评LLM,他也给出了自己的解决方案——JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)。

这个名字听起来很唬人,但核心思想其实异常简洁:

不要在原始数据空间里做预测,而是先在抽象表示空间里做预测。

传统的生成模型(比如视频预测模型)试图直接生成下一帧像素级的画面。LeCun认为这是在浪费算力——你把大量资源花在预测"吊灯上那个反光点会偏移0.3毫米"这种事情上,而这些细节根本不重要。

JEPA的做法是:

  1. 把当前画面通过一个编码器映射到一个抽象表示空间(比如一个512维的向量,它代表的是"房间里有两个人、一张桌子、一盏灯"这种级别的信息)。
  2. 在这个抽象空间里做预测——“下一个时间步的抽象表示应该是什么”。
  3. 这个预测只关注可预测的结构(物体位置、关系、运动趋势),自动忽略不可预测的细节(纹理、光照、噪声)。

这就像物理学的做法:我们不会去模拟每一个空气分子,而是把空气抽象成温度、密度、压强,然后解Navier-Stokes方程。每一个抽象层级,都是为了在忽略下层细节的同时,保留足够的结构来做预测。

LeCun说过一句话很精辟:“物理学家几百年来一直在做这件事——寻找能支持预测的抽象表示。JEPA不过是让AI也学会这一招。”

四、2026年,世界模型正在爆发

如果世界模型只是LeCun一个人的执念,那可能只是学术界的又一个有趣想法。但2026年的现实是:世界模型正在各个方向同时爆发。

自动驾驶

自动驾驶是世界模型最直接的落地场景。2026年9月发表的多项研究表明,基于JEPA的潜在世界模型已经在导航和驾驶任务中展现出强大能力。核心优势是:模型可以在"脑内"模拟未来路况,预测其他车辆的行为,然后在真正执行之前评估多种方案。

这比"看到红灯就停"的规则系统强大得多——因为它可以处理从未遇到过的复杂情况。

机器人

KAIST在2026年9月的ECCV会议上发表了CURE技术,让设备端的AI模型能够积累和复用从服务器学到的知识。虽然这不是严格意义上的世界模型,但它代表了同一个趋势:AI不再只是"一问一答",而是在与世界交互中不断积累对世界的理解。

视频与交互环境

这可能是最"酷"的方向。2026年涌现了一批令人惊艳的世界模型项目:

  • WorldCrafter:从一张图片或一段文字出发,生成可以"镜头漫游"的一致视频——它内部学到了隐式的3D结构,所以你可以像玩游戏一样在不同角度之间自由切换。
  • EchoWM:一个全模态世界模型,可以同时生成720p视频、环境音效、背景音乐和语音,而且在长时间生成中保持同步。想象一下:你可以"走进"一张照片,听到风声、鸟鸣,甚至听到照片里的人在说话。
  • DreamX-World:把双向视频生成器变成了可交互的世界模型——你可以在生成的世界里执行动作,世界会根据你的行为实时变化。

资本涌入

Forbes报道,2026年上半年,风险投资人向世界模型初创公司投入了超过30亿美元。仅AMI Labs一家就拿了10.3亿。这不是小众学术方向了——这是真金白银的赛道。

五、争议与思考

当然,世界模型也不是没有质疑。

最大的争议在于:LLM的能力上限到底在哪里?

LeCun认为LLM有天花板,但另一派研究者——包括很多在Scaling Law上押重注的人——认为只要给LLM足够的推理能力(比如GPT-6 Astra在ARC-AGI-3上从7.8%跳到62.7%),它们可能"涌现"出某种形式的世界理解。

还有一个更深层的问题:AI真的需要"理解"物理世界吗? 如果一个AI助手只需要处理文本和代码,世界模型对它来说就是多余的。世界模型的价值,更多体现在需要与物理环境交互的场景——机器人、自动驾驶、科学实验。

但LeCun的回应一直很直接:“如果你认为仅靠阅读所有关于物理学的书籍就能学会骑自行车,那你可以继续相信纯文本路线。”

我觉得这句话虽然尖锐,但点到了一个核心:知识和理解是两回事。LLM可以从文本中学到"骑自行车需要保持平衡",但它不会因此就真的会骑车。真正的理解,来自于与世界的交互——来自于动作、反馈和后果。

六、写在最后

世界模型的崛起,本质上是在回答一个古老的问题:智能的本质到底是什么?

是语言?是推理?还是对世界的内在建模?

LeCun押注的是后者。他认为,人类智能的核心不是"会说话",而是"能预测"——能在脑中模拟世界的运转,然后据此规划行动。语言只是这种能力的一个子集,而不是全部。

2026年,这场赌局才刚刚开始。AMI Labs的第一版世界模型还在研发中,JEPA的理论框架还需要更多实验验证,世界模型在工程落地中也面临大量挑战。

但有一点已经很清楚了:AI的未来,不仅仅是"更大的语言模型"这一条路。在世界模型这个方向上,有一群顶尖的研究者正在探索一条完全不同的路径——一条可能更接近"真正智能"的路径。

至于这条路最终能走多远,我们拭目以待。


参考来源:

  1. LeCun, Y. “从大模型到世界模型——AGI路线图”, 2026人工智能与下一代计算峰会演讲, 2026年7月
  2. AMI Labs种子轮融资公告, TechCrunch, 2026年3月
  3. Yu, W. et al. “WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory”, arXiv, 2026年9月
  4. Lee, J. et al. “CURE: Cumulative Knowledge Reuse for Efficient Device-Server Hybrid Inference”, ECCV 2026
  5. Zhang, S. et al. “EchoWM: Open and Enterable Omnimodal World Models”, 2026
  6. Terver, B. et al. “What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?”, Transactions on Machine Learning Research, 2026
  7. Maes, L. et al. “LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels”, arXiv, 2026
  8. Forbes: “Venture investors committed more than $3 billion to world model startups in H1 2026”