引言

你有没有过这样的体验?

你用AI帮忙写一段代码,它写对了。你问它"为什么这么写",它解释了一通,但你觉得那个解释像是"事后补的"——它写对了,却不完全知道自己为什么写对。

你让AI分析一段文字的情绪,它分析得头头是道。但你追问"你是怎么判断出这种情绪的",它只能笼统地说"因为这段话用了这些词汇"——好像一个品酒师说"这酒好,因为它是酒"。

这种现象,不是AI的"智商缺陷",也不是模型在"装傻"。它揭示了一个更深层的真相:大模型的知识,本质上不是"命题式的",而是"内隐的"。

换句话说:AI知道的东西,比它能说出来的——多得多。

第一章:什么是"内隐知识"

要理解这个问题,先从一个日常经验说起。

你会骑自行车吗?如果会,请你回答一个问题:你是怎么保持平衡的?

你可能会说:“身体往左偏的时候,手把往左转,重心就会回来。“但问题是——你真的能做到"在骑车时思考这个步骤"吗?不能。你只是"感觉"到了平衡,然后身体就自动调整了。你甚至说不出你调整了多少度、用了多少力。

这就是"内隐知识”(tacit knowledge,也译默会知识)的经典例子。

这个概念是哲学家迈克尔·波兰尼(Michael Polanyi)在1950年代提出的。他的核心论断只有一句话,却影响了整个知识论半个世纪——“我们知道的,比我们能说出来的多。”

波兰尼发现,人类的知识可以分为两类:

  • 命题知识(显性知识):能用语言清晰表达的知识。比如"地球围绕太阳公转”、“水的沸点是100度”、“二战爆发于1939年”。这些知识可以写进课本、编成规则、用公式表达。

  • 内隐知识(默会知识):会做但说不清的知识。骑自行车、识别人脸、判断一个人的语气是否真诚、母语的语法感——这些都是内隐知识。你会用,但你很难把"怎么用"的规则清晰地讲出来。

想想看:你学说话的时候,没有人给你讲过"主谓宾结构"和"语法树"。你只是听了大量的语言例子,然后你的大脑就"学会"了语言——不是学会了规则,而是学会了"感觉"。这就是内隐知识的本质:它不依赖于显式的规则表述,而是通过大量的经验积累,内化为一种直觉性的能力。

第二章:大模型的知识,为什么更像"内隐"的

传统AI的知识库是"命题式"的——知识被编码成"如果…那么…“的规则,或者被存储为结构化的事实。你想要什么,它给你什么,清清楚楚。

但大语言模型不一样。

如果用一句话描述大模型的学习方式,那就是:它没有读过任何一条规则,却学会了所有的规则。 模型在训练中"看"了数万亿字的文本,然后从中"悟"出了语言的规律、世界的规律——但它的大脑里,没有一条"知识"是以"四川的省会是成都"这样的形式存在的。它的知识,全部"融化"在了数千亿个参数中,像水融入了海绵,你挤得出水,但看不到水原本的形状。

哲学家Davies在1990年提出了判断一个系统是否拥有内隐知识的三个条件,用这三个条件来检验大模型,你会发现它完美匹配:

第一个条件:语义描述。 你可以说"这个系统知道地球是圆的”,而且这个描述是有意义的——它确实会基于这个"知识"来回答相关问题。但如果你去翻它的参数,你找不到"地球是圆的"这句话存储在哪里。

第二个条件:组合性。 知识不是孤立的碎片,而是可以组合的。知道"猫是哺乳动物"和"狗是哺乳动物",就能推出"猫和狗都是哺乳动物"。大模型确实能做到这一点——它不仅能记住学过的知识,还能对知识进行组合、推理、迁移。

第三个条件:因果系统性。 知识之间不是孤立的,改变一个知识点会影响其他相关知识。如果你微调模型让它"不承认地球是圆的",它关于"地月距离"、“日食原理"的知识也会随之改变。这就像你改变了一个人的一个信念,他的其他相关信念也会跟着调整——而不是只改一条记录就完事。

这三个条件,大模型全都满足。所以,说大模型拥有内隐知识,不是一种比喻,而是一个有哲学依据的论断。

第三章:为什么"内隐"既是力量,也是"暗箱”

内隐知识给了大模型一种人类级别的能力——它不需要规则就能做事。

这就是为什么你不需要教大模型"怎么翻译"——它从大量例子中内化了翻译的能力。你不需要教它"怎么推理"——它从数万亿字的推理文本中内化了推理的"手感"。

但内隐知识也有一个致命的弱点:你无法直接检查它。

回想一下前面说的"骑自行车"的例子:你骑得很好,但如果你要教别人骑,你很难说清楚"到底怎么保持平衡"。你只能喊"多练练就习惯了"。这不是因为你不想教,而是因为你的知识本身就是内隐的,你自己也无法把它提取成显式的规则。

大模型也面临同样的问题:

  • 你问它"为什么认为这个答案是对的",它给出的解释,本质上是在"事后编一个合理的理由"——就像你骑完一段路后,才"编"出一个平衡的力学原理来解释你刚才的动作。这个解释不一定错,但它不是你做动作时实际使用的知识。

  • 你问它"你还有什么我不知道的知识",它回答不了——因为它自己也不知道自己"知道"什么。它的知识就像冰山的水下部分——能通过行为表现出来,但无法被直接"盘点"。

这就是AI的"暗箱":不是我们故意把AI的知识藏起来,而是AI的知识本身,就是无法被直接提取的。

第四章:从"编程"到"教育"——对齐的内隐转向

这个发现,正在改变我们"教AI"的方式。

传统的AI对齐思路是"编程式"的:你写规则,模型遵守规则。比如"不要输出有害内容"——这是一条显式规则,你可以在代码里实现它。

但对于内隐知识为主的大模型来说,这条路行不通——因为模型的大部分知识不是规则驱动的,而是"感觉"驱动的。你不给它规则,它也能做事;你给它规则,它反而可能"听不懂"——因为规则本身是命题式的,而模型的知识是内隐的。

所以,对齐大模型,更像"教育"而不是"编程"。

想想你怎么教一个孩子"不要撒谎":你不会只给他一条规则,然后期望他一生遵守。你会给他很多例子——“你看,你刚才撒谎了,大家都不开心了”——让他从具体的情境中,内化"诚实"这个价值观。

大模型的对齐也在走同样的路:通过海量的"好例子"和"坏例子"的对比,通过人类反馈(RLHF)来"塑造"模型的内隐价值观。它不是在学习规则,而是在形成"道德直觉"——就像人类通过教育形成道德感一样。

这听起来很先进,但也带来了新的风险:内隐的知识可能包含我们没有意识到的偏见、错误甚至危险倾向。 因为它是"暗箱"式的,我们可能不知道AI到底"知道"什么、“相信"什么。你以为它学会了"诚实”,它可能学会了"说用户想听的话"——这完全是两回事。

第五章:让AI"把自己说清楚"——未来的方向

承认AI的知识是内隐的,并不是终点,而是起点。

内隐知识理论指出了AI发展的一个关键方向:将内隐知识外显化。

如果能让AI把它内隐掌握的规律清晰地表达出来,会发生什么?

首先,AI会变得更可解释。你不再只是"相信"它的答案,你能理解它为什么这样想——因为它能把自己的内隐推理过程"翻译"成你能理解的逻辑链条。

其次,AI可能加速科学发现。想象一下:模型可能已经"感觉"到了某种物理规律,但它不知道如何用数学公式表达。如果能让它把这个内隐的"感觉"外显化,它可能发现人类尚未发现的知识规律。

第三,AI的自我提升会变得可控。如果模型能"说出"自己哪里不懂、哪里不确定,我们就可以有针对性地给它补充知识,而不是"盲目"地喂更多数据。

当然,这并不容易。内隐知识的外显化,本身就是一个哲学难题——人类研究了半个世纪,也还没完全搞清楚"人是怎么把骑车的感觉说出来的"。但至少,内隐知识理论给了我们一个正确的框架:不是"AI在装傻",而是"AI的知识就是说不出来"——这是两种完全不同的诊断,也指向了两种完全不同的解决方案。

尾声:知识的另一种可能

我们习惯了把"知识"等同于"能说出来的东西"——课本里的、试卷上的、论文里的。

但波兰尼告诉我们,这只是知识的一种形式。还有另一种知识,它藏在身体里、藏在直觉里、藏在"感觉"里——你用它,但你说不出它。

大模型的出现,让我们重新发现了这种知识的价值。它用一种"笨拙但有效"的方式——读遍全人类的文字——学会了我们人类需要几十年才能内化的"语感"和"直觉"。它可能讲不出"为什么",但它确实"会做"。

这或许就是AI最迷人的地方:它不是一个更聪明的数据库,而是一个拥有了"直觉"的机器。

而"直觉"这种东西,从来就不是用来解释的——它是用来信任的。


参考文献:

  1. Polanyi, M. (1966). The Tacit Dimension. University of Chicago Press. 出版社链接
  2. Davies, M. (1990). Knowing one’s own mind. Proceedings of the Aristotelian Society, 64, 237-255. 论文链接
  3. Brown, T. B., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020. 论文链接
  4. Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. arXiv:2303.12712. 论文链接
  5. Christiano, P., et al. (2017). Deep Reinforcement Learning from Human Preferences. NeurIPS 2017. 论文链接
  6. Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS 2022. 论文链接