<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>自动驾驶 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6/</link>
		<description>Recent content in 自动驾驶 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 08 Oct 2026 02:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E8%87%AA%E5%8A%A8%E9%A9%BE%E9%A9%B6/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的下一场革命不是更大的语言模型，而是让它&#39;理解&#39;这个世界——世界模型凭什么拿下10亿美元赌注？</title>
				<link>https://lingyu7.com/posts/ai-world-models-jepa-lecun-2026/</link>
				<pubDate>Thu, 08 Oct 2026 02:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-world-models-jepa-lecun-2026/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;2026年3月，一个消息在AI圈炸开了锅：Yann LeCun——深度学习三巨头之一、图灵奖得主——离开了待了12年的Meta，创办了一家叫AMI Labs的公司，种子轮融了10.3亿美元，估值35亿。&lt;/p&gt;&#xA;&lt;p&gt;投资人阵容堪称豪华：Nvidia、三星、淡马锡、丰田、贝索斯……&lt;/p&gt;&#xA;&lt;p&gt;但最让人好奇的不是钱，而是LeCun要拿这些钱去做什么。&lt;/p&gt;&#xA;&lt;p&gt;他的答案只有三个字：&lt;strong&gt;世界模型&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;而且他在多个场合反复强调一句话：&amp;ldquo;语言模型永远到不了AGI。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;这话从一个图灵奖得主嘴里说出来，分量不轻。他到底在赌什么？世界模型又是什么？今天我们就来聊清楚这件事。&lt;/p&gt;&#xA;&lt;h2 id=&#34;一为什么猜下一个词永远不够&#34;&gt;一、为什么&amp;quot;猜下一个词&amp;quot;永远不够？&lt;/h2&gt;&#xA;&lt;p&gt;要理解世界模型，先要搞明白一个问题：LeCun为什么觉得LLM这条路走不通？&lt;/p&gt;&#xA;&lt;p&gt;其实他的论证非常直觉。&lt;/p&gt;&#xA;&lt;p&gt;LLM的核心能力是&amp;quot;预测下一个词&amp;quot;。给它一段文字，它根据训练中学到的统计规律，猜测后面最可能跟什么词。这个能力在文本领域极其强大，因为文本是离散的——词汇表是有限的（比如10万个token），所以模型可以对每一种可能性打分，输出一个概率分布。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;但现实世界不是离散的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;LeCun举了一个非常生动的例子：假设你拍了一段房间的视频，镜头慢慢扫过去，然后停住。你让AI预测下一帧画面会是什么。&lt;/p&gt;&#xA;&lt;p&gt;AI可以猜到大致的东西——这是一个房间，有人坐在桌前。但它&lt;strong&gt;不可能&lt;/strong&gt;预测出每个人脸上具体的表情、地毯的纹理、吊灯上的反光。因为现实世界中，我们观察到的大部分细节，&lt;strong&gt;本质上就是不可预测的&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;你可以预测关上门窗后加热空气，温度和压强会怎么变——因为有PV=nRT。但你不可能预测每一个空气分子的运动轨迹。分子太多了，根本算不过来。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是LLM路线在真实世界遇到的根本困难&lt;/strong&gt;：如果你硬逼模型去预测所有细节，唯一的办法是给它塞一个&amp;quot;潜变量&amp;quot;来补充信息。但这个潜变量最后往往会承载绝大部分预测所需的信息，于是整个预测就变成了&amp;quot;复读&amp;quot;——模型并没有真正理解什么，只是把输入搬到了输出。&lt;/p&gt;&#xA;&lt;p&gt;换句话说：&lt;strong&gt;LLM擅长在离散符号的世界里做推理，但真实世界是连续的、高维的、充满不确定性的。用&amp;quot;猜下一个词&amp;quot;的方式去理解世界，就像用计算器去画油画——工具本身就不对路。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;二世界模型到底是什么&#34;&gt;二、世界模型到底是什么？&lt;/h2&gt;&#xA;&lt;p&gt;好了，问题清楚了。那世界模型又是什么？&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;一句话版本：世界模型就是一个AI内部的&amp;quot;物理引擎&amp;quot;——它不重建世界的每一个细节，而是学到世界的&amp;quot;骨架&amp;quot;，然后用这个骨架去预测、规划和行动。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;让我用一个更生活化的比喻来解释。&lt;/p&gt;&#xA;&lt;p&gt;想象你正在学开车。开了一个月之后，你不需要每一步都&amp;quot;计算&amp;quot;——前面有红灯就踩刹车，变道前先看后视镜，下雨天减速。你的大脑里已经形成了一个关于&amp;quot;交通世界&amp;quot;的内在模型。这个模型不是对每一帧视觉画面的精确复刻，而是一个&lt;strong&gt;抽象的、抓重点的&lt;/strong&gt;理解。&lt;/p&gt;&#xA;&lt;p&gt;你知道&amp;quot;红灯→停车&amp;quot;这个因果关系，不需要记住每一个路口的红灯长什么样。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;世界模型就是AI版本的这种&amp;quot;内在理解&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体来说，一个好的世界模型应该能做到三件事：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;抽象表示&lt;/strong&gt;：从海量的感官输入（图像、声音、传感器数据）中提取出真正重要的结构，忽略无关细节。就像你开车时不会去注意路边的广告牌内容，但会注意到前方车辆是否在减速。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;预测未来&lt;/strong&gt;：给定当前状态和一个动作，预测世界会变成什么样。&amp;ldquo;如果我打方向盘向左，车会怎么动？&amp;quot;——你的大脑可以在不真正执行动作的情况下&amp;quot;模拟&amp;quot;出结果。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;支持规划&lt;/strong&gt;：有了预测能力，AI就可以在脑中&amp;quot;试错&amp;rdquo;——先模拟10种可能的行动方案，选出最好的那个再去执行。这比直接随机尝试要高效得多。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;这三点加在一起，就是LeCun眼中AI通向真正智能的路径。&lt;/p&gt;&#xA;&lt;h2 id=&#34;三jepalecun的药方&#34;&gt;三、JEPA：LeCun的药方&lt;/h2&gt;&#xA;&lt;p&gt;LeCun不仅在批评LLM，他也给出了自己的解决方案——&lt;strong&gt;JEPA（Joint Embedding Predictive Architecture，联合嵌入预测架构）&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这个名字听起来很唬人，但核心思想其实异常简洁：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;不要在原始数据空间里做预测，而是先在抽象表示空间里做预测。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;传统的生成模型（比如视频预测模型）试图直接生成下一帧像素级的画面。LeCun认为这是在浪费算力——你把大量资源花在预测&amp;quot;吊灯上那个反光点会偏移0.3毫米&amp;quot;这种事情上，而这些细节根本不重要。&lt;/p&gt;&#xA;&lt;p&gt;JEPA的做法是：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;把当前画面通过一个编码器映射到一个&lt;strong&gt;抽象表示空间&lt;/strong&gt;（比如一个512维的向量，它代表的是&amp;quot;房间里有两个人、一张桌子、一盏灯&amp;quot;这种级别的信息）。&lt;/li&gt;&#xA;&lt;li&gt;在这个抽象空间里做预测——&amp;ldquo;下一个时间步的抽象表示应该是什么&amp;rdquo;。&lt;/li&gt;&#xA;&lt;li&gt;这个预测只关注&lt;strong&gt;可预测的结构&lt;/strong&gt;（物体位置、关系、运动趋势），自动忽略不可预测的细节（纹理、光照、噪声）。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就像物理学的做法：我们不会去模拟每一个空气分子，而是把空气抽象成温度、密度、压强，然后解Navier-Stokes方程。每一个抽象层级，都是为了在忽略下层细节的同时，保留足够的结构来做预测。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;LeCun说过一句话很精辟：&amp;ldquo;物理学家几百年来一直在做这件事——寻找能支持预测的抽象表示。JEPA不过是让AI也学会这一招。&amp;rdquo;&lt;/p&gt;&#xA;&lt;h2 id=&#34;四2026年世界模型正在爆发&#34;&gt;四、2026年，世界模型正在爆发&lt;/h2&gt;&#xA;&lt;p&gt;如果世界模型只是LeCun一个人的执念，那可能只是学术界的又一个有趣想法。但2026年的现实是：&lt;strong&gt;世界模型正在各个方向同时爆发。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;自动驾驶&#34;&gt;自动驾驶&lt;/h3&gt;&#xA;&lt;p&gt;自动驾驶是世界模型最直接的落地场景。2026年9月发表的多项研究表明，基于JEPA的潜在世界模型已经在导航和驾驶任务中展现出强大能力。核心优势是：模型可以在&amp;quot;脑内&amp;quot;模拟未来路况，预测其他车辆的行为，然后在真正执行之前评估多种方案。&lt;/p&gt;&#xA;&lt;p&gt;这比&amp;quot;看到红灯就停&amp;quot;的规则系统强大得多——因为它可以处理从未遇到过的复杂情况。&lt;/p&gt;&#xA;&lt;h3 id=&#34;机器人&#34;&gt;机器人&lt;/h3&gt;&#xA;&lt;p&gt;KAIST在2026年9月的ECCV会议上发表了CURE技术，让设备端的AI模型能够积累和复用从服务器学到的知识。虽然这不是严格意义上的世界模型，但它代表了同一个趋势：AI不再只是&amp;quot;一问一答&amp;quot;，而是&lt;strong&gt;在与世界交互中不断积累对世界的理解&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h3 id=&#34;视频与交互环境&#34;&gt;视频与交互环境&lt;/h3&gt;&#xA;&lt;p&gt;这可能是最&amp;quot;酷&amp;quot;的方向。2026年涌现了一批令人惊艳的世界模型项目：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;WorldCrafter&lt;/strong&gt;：从一张图片或一段文字出发，生成可以&amp;quot;镜头漫游&amp;quot;的一致视频——它内部学到了隐式的3D结构，所以你可以像玩游戏一样在不同角度之间自由切换。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;EchoWM&lt;/strong&gt;：一个全模态世界模型，可以同时生成720p视频、环境音效、背景音乐和语音，而且在长时间生成中保持同步。想象一下：你可以&amp;quot;走进&amp;quot;一张照片，听到风声、鸟鸣，甚至听到照片里的人在说话。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;DreamX-World&lt;/strong&gt;：把双向视频生成器变成了可交互的世界模型——你可以在生成的世界里执行动作，世界会根据你的行为实时变化。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;资本涌入&#34;&gt;资本涌入&lt;/h3&gt;&#xA;&lt;p&gt;Forbes报道，2026年上半年，风险投资人向世界模型初创公司投入了超过&lt;strong&gt;30亿美元&lt;/strong&gt;。仅AMI Labs一家就拿了10.3亿。这不是小众学术方向了——这是真金白银的赛道。&lt;/p&gt;&#xA;&lt;h2 id=&#34;五争议与思考&#34;&gt;五、争议与思考&lt;/h2&gt;&#xA;&lt;p&gt;当然，世界模型也不是没有质疑。&lt;/p&gt;&#xA;&lt;p&gt;最大的争议在于：&lt;strong&gt;LLM的能力上限到底在哪里？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;LeCun认为LLM有天花板，但另一派研究者——包括很多在Scaling Law上押重注的人——认为只要给LLM足够的推理能力（比如GPT-6 Astra在ARC-AGI-3上从7.8%跳到62.7%），它们可能&amp;quot;涌现&amp;quot;出某种形式的世界理解。&lt;/p&gt;&#xA;&lt;p&gt;还有一个更深层的问题：&lt;strong&gt;AI真的需要&amp;quot;理解&amp;quot;物理世界吗？&lt;/strong&gt; 如果一个AI助手只需要处理文本和代码，世界模型对它来说就是多余的。世界模型的价值，更多体现在需要与物理环境交互的场景——机器人、自动驾驶、科学实验。&lt;/p&gt;&#xA;&lt;p&gt;但LeCun的回应一直很直接：&amp;ldquo;如果你认为仅靠阅读所有关于物理学的书籍就能学会骑自行车，那你可以继续相信纯文本路线。&amp;rdquo;&lt;/p&gt;&#xA;&lt;p&gt;我觉得这句话虽然尖锐，但点到了一个核心：&lt;strong&gt;知识和理解是两回事&lt;/strong&gt;。LLM可以从文本中学到&amp;quot;骑自行车需要保持平衡&amp;quot;，但它不会因此就真的会骑车。真正的理解，来自于与世界的交互——来自于动作、反馈和后果。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
