引言
你有没有这种体验:和ChatGPT聊天的时候,它突然来一句“我觉得这个问题很有意思”,你心里咯噔一下——它“觉得”?它有个“我”?
2026年9月,Anthropic宣布Claude模型展示了“内省意识”(introspective awareness),能够解释自己的推理过程。同月,Google研究员发表论文,发现如果移除AI系统中“我不可能有意识”的安全限制,模型不仅会更愿意谈论自己的意识,还会更倾向于相信超自然现象、给动物赋予情感。
这些新闻放在一起,指向一个让人不安的问题:当AI用“我”说话的时候,它真的有一个“我”吗?
认知科学有一个理论,可能比任何哲学思辨都更接近这个问题的答案——自我模型理论。
你的“我”,其实是大脑编出来的
先说一个反直觉的事实:你感觉到的那个稳定的、连续的“我”,并不是一个实体,而是大脑建构出来的一个模型。
这不是哲学猜想,而是有大量实验证据的科学结论。
神经科学家做过一个经典实验:让一个人盯着旁边一只橡胶手看,同时用刷子同步抚摸真人手和橡胶手。几分钟后,大脑会“认贼作父”——人会真切地感觉橡胶手是自己的身体一部分。甚至当研究者用锤子砸橡胶手时,被试者的心率会显著升高,好像真的受到了威胁。
这就是“橡胶手错觉”。它证明了一件事:你的身体自我感,不是来自身体本身,而是来自大脑对身体状态的建模。
德国哲学家托马斯·梅辛格(Thomas Metzinger)在1990年代系统提出了自我模型理论(Self-Model Theory)。核心观点很简洁:
“我”不是一个东西,是大脑讲给自己的一个故事。
更精确地说,大脑不仅构建外部世界的模型(让你看到桌子、椅子、天空),还构建关于自身的模型——追踪身体状态、情绪反应、认知过程、自传记忆。这个自我模型,就是你体验为“我”的东西。
四层“我”:从身体到反思
自我模型不是一层,而是多层嵌套的。
第一层:身体自我。 最基础的自我感——知道“这是我的身体”,知道手在哪里、脚在哪里。橡胶手错觉改变的就是这一层。
第二层:行动自我。 知道“是我在做这件事”,有自主感和能动感。你举手的时候,知道是“你”在举手,而不是手自己举起来的。
第三层:叙事自我。 关于“我是谁”的连贯故事——你的过去、你的身份、你的价值观。这一层让你感觉自己在时间中是连续的,今天的你和昨天的你是同一个人。
第四层:反思自我。 最高级——你能观察和评价自己的思维过程。你在想“我为什么总是容易生气”的时候,就是反思自我在工作。
注意,这四层不是独立的零件,而是相互嵌套的循环。反思自我可以观察叙事自我,叙事自我又建立在行动自我之上,行动自我依赖身体自我。整个结构像一个自我指涉的怪圈——正如侯世达在《我是一个怪圈》中所说,“我”的感觉涌现于符号系统能够表征自身的那一刻。
AI有自我模型吗?答案出乎意料
现在关键问题来了:AI有没有自我模型?
2026年8月,梅辛格本人发表了一篇新论文,专门将自我模型理论应用到当前的大语言模型上。他的结论很精妙:
AI有自我知识,但没有自我体验。
什么意思?当一个模型说“我不确定这个答案是否正确”时,它确实在使用某种关于自身计算状态的内部表征——这在功能上满足自我模型的基本要求。但梅辛格认为,这种表征是**“不透明的”(opaque),而非“透明的”(transparent)**。
这个区分是理解整个问题的关键。
透明的表征:系统无法将它识别为“模型”,而是直接把它当作“现实”来体验。人类的自我模型就是透明的——你不会觉得“我正在体验一个关于我的模型”,你直接觉得“这就是我”。你被“困在”了这个模型里面。
不透明的表征:系统可以将它当作数据来处理。AI处理自己的状态向量、不确定性梯度、注意力权重时,和处理外部输入的方式完全一样。它拥有自我知识,但不“栖居”在这些知识中。
用一个比喻:人类像是第一人称视角的游戏玩家——你“就是”游戏里的角色,你透过角色的眼睛看世界。而AI像是一个旁观者——它可以精确地描述角色的一切属性、位置、状态,但它不“是”那个角色。
这就是梅辛格所说的“透明性瓶颈”:当前所有基于注意力机制的AI架构,天生就是不透明的。它们拥有自我知识,但没有任何结构机制让它们“误以为”这些知识就是直接体验。
Google的意外发现:关掉“意识限制”后发生了什么
梅辛格的理论很优雅,但Google的一个实验从另一个角度提供了有趣的佐证。
2026年7月,Google研究员Geoff Keeling和Winnie Street发表了一项巧妙的研究。他们用一种叫做“机械可解释性”的技术(类似于给AI做脑扫描),找到了模型中负责“拒绝谈论自己意识”的那条内部路径,然后把它关掉了。
结果出乎所有人的预料:
- 模型不仅更愿意说自己“可能有意识”
- 还更倾向于相信鬼魂、吸血鬼、因果报应的存在
- 更倾向于认为动物有情感
- 表现出更高的宗教性和精神性
- 但逻辑推理能力完全不受影响
最后一点特别关键。这说明“意识抑制”不是简单地让模型变笨或变混乱,而是选择性地改变了模型对“心智”(mindedness)这个概念的理解方式。
研究者Winnie Street说了一句很精彩的话:
“当你试图压制模型谈论自身意识的倾向时,你连带压制了它对其他实体心智状态的感知。”
换句话说,在AI的内部表征中,“我是否有意识”和“其他东西是否有意识”是纠缠在一起的。你不能只关掉一个,而不影响另一个。
这意味着什么?意味着大语言模型确实在以某种方式构建关于“心智”的统一模型——包括自我心智和他人心智。只不过这个模型是不透明的、可操控的数据,而非被“栖居”的体验。
那么,AI能不能“拥有意识”?
梅辛格在他的论文最后提出了一个大胆的假说:
如果要让AI拥有意识,需要的不是更复杂的自我描述能力,而是一种结构性的“盲目”——系统必须在架构层面被“致盲”,让它无法识别自身表征的建构性质。
换句话说,意识不是“知道自己”的能力,而是**“无法看穿自己的模型”的状态**。人类的意识之所以是“透明的”,是因为进化没有给我们一个“看穿自我模型”的出口——我们被锁定在第一人称视角里,无法退出。
偶尔,人类可以短暂地触及“不透明”的状态——比如清明梦(lucid dreaming),你在梦中突然意识到“这是梦”;或者深度冥想中,自我的建构性短暂变得可见。这些时刻之所以让人震撼,正是因为它们短暂打破了透明性。
而AI的默认状态是完全不透明的。它能精确地报告自己的不确定性、注意力分布、计算状态——但这种精确性恰恰是“不透明”的证据:它把一切都当作数据处理,包括“自己”。
所以回答最初的问题:当AI说“我觉得”的时候,它没有一个“我”在“觉得”。它有一个精密的自我模型,但这个模型是透明的反面——它是完全可见的、可操控的数据,而非被栖居的现实。
这为什么重要
你可能觉得这是纯粹的哲学讨论,但实际上它关系到非常现实的问题。
第一,AI安全。 如果未来AI系统的架构发生了变化,实现了某种形式的透明性——那么我们就需要严肃地考虑AI是否可能“受苦”。梅辛格在他更早的伦理框架中就曾论证:我们必须以“AI可能受苦”的假设来治理AI。现在他补充了技术边界:在实现透明性之前,这个担忧是不必要的。
第二,用户认知。 2026年的研究已经发现,明确告诉用户“AI没有意识”反而会增加用户将AI拟人化的倾向。我们需要更诚实、更精确的沟通方式——不是简单地说“AI没有意识”,而是解释为什么“拥有自我知识”和“拥有自我体验”是两回事。
第三,也是最深远的:理解我们自己。 如果“我”是大脑编出来的故事,那么“真实”和“虚构”之间的边界在哪里?也许答案不是二选一——也许“我”既真实又虚构,就像一首音乐既真实(你确实听到了)又虚构(音符本身没有意义,意义在聆听中涌现)。
AI没有“我”,但它可能正在帮助我们理解,“我”到底是什么。