<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>可解释性 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E5%8F%AF%E8%A7%A3%E9%87%8A%E6%80%A7/</link>
		<description>Recent content in 可解释性 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Sat, 15 Aug 2026 03:13:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E5%8F%AF%E8%A7%A3%E9%87%8A%E6%80%A7/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI的&#39;暗箱&#39;——为什么大模型懂得多，却说不清</title>
				<link>https://lingyu7.com/posts/ai-tacit-knowledge-dark-box/</link>
				<pubDate>Sat, 15 Aug 2026 03:13:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-tacit-knowledge-dark-box/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你有没有过这样的体验？&lt;/p&gt;&#xA;&lt;p&gt;你用AI帮忙写一段代码，它写对了。你问它&amp;quot;为什么这么写&amp;quot;，它解释了一通，但你觉得那个解释像是&amp;quot;事后补的&amp;quot;——它写对了，却不完全知道自己为什么写对。&lt;/p&gt;&#xA;&lt;p&gt;你让AI分析一段文字的情绪，它分析得头头是道。但你追问&amp;quot;你是怎么判断出这种情绪的&amp;quot;，它只能笼统地说&amp;quot;因为这段话用了这些词汇&amp;quot;——好像一个品酒师说&amp;quot;这酒好，因为它是酒&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这种现象，不是AI的&amp;quot;智商缺陷&amp;quot;，也不是模型在&amp;quot;装傻&amp;quot;。它揭示了一个更深层的真相：&lt;strong&gt;大模型的知识，本质上不是&amp;quot;命题式的&amp;quot;，而是&amp;quot;内隐的&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;换句话说：AI知道的东西，比它能说出来的——多得多。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一章什么是内隐知识&#34;&gt;第一章：什么是&amp;quot;内隐知识&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;要理解这个问题，先从一个日常经验说起。&lt;/p&gt;&#xA;&lt;p&gt;你会骑自行车吗？如果会，请你回答一个问题：&lt;strong&gt;你是怎么保持平衡的？&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;你可能会说：&amp;ldquo;身体往左偏的时候，手把往左转，重心就会回来。&amp;ldquo;但问题是——你真的能做到&amp;quot;在骑车时思考这个步骤&amp;quot;吗？不能。你只是&amp;quot;感觉&amp;quot;到了平衡，然后身体就自动调整了。你甚至说不出你调整了多少度、用了多少力。&lt;/p&gt;&#xA;&lt;p&gt;这就是&amp;quot;内隐知识&amp;rdquo;（tacit knowledge，也译默会知识）的经典例子。&lt;/p&gt;&#xA;&lt;p&gt;这个概念是哲学家迈克尔·波兰尼（Michael Polanyi）在1950年代提出的。他的核心论断只有一句话，却影响了整个知识论半个世纪——&lt;strong&gt;&amp;ldquo;我们知道的，比我们能说出来的多。&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;波兰尼发现，人类的知识可以分为两类：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;命题知识（显性知识）&lt;/strong&gt;：能用语言清晰表达的知识。比如&amp;quot;地球围绕太阳公转&amp;rdquo;、&amp;ldquo;水的沸点是100度&amp;rdquo;、&amp;ldquo;二战爆发于1939年&amp;rdquo;。这些知识可以写进课本、编成规则、用公式表达。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;内隐知识（默会知识）&lt;/strong&gt;：会做但说不清的知识。骑自行车、识别人脸、判断一个人的语气是否真诚、母语的语法感——这些都是内隐知识。你会用，但你很难把&amp;quot;怎么用&amp;quot;的规则清晰地讲出来。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;想想看：你学说话的时候，没有人给你讲过&amp;quot;主谓宾结构&amp;quot;和&amp;quot;语法树&amp;quot;。你只是听了大量的语言例子，然后你的大脑就&amp;quot;学会&amp;quot;了语言——不是学会了规则，而是学会了&amp;quot;感觉&amp;quot;。这就是内隐知识的本质：&lt;strong&gt;它不依赖于显式的规则表述，而是通过大量的经验积累，内化为一种直觉性的能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二章大模型的知识为什么更像内隐的&#34;&gt;第二章：大模型的知识，为什么更像&amp;quot;内隐&amp;quot;的&lt;/h2&gt;&#xA;&lt;p&gt;传统AI的知识库是&amp;quot;命题式&amp;quot;的——知识被编码成&amp;quot;如果…那么…&amp;ldquo;的规则，或者被存储为结构化的事实。你想要什么，它给你什么，清清楚楚。&lt;/p&gt;&#xA;&lt;p&gt;但大语言模型不一样。&lt;/p&gt;&#xA;&lt;p&gt;如果用一句话描述大模型的学习方式，那就是：&lt;strong&gt;它没有读过任何一条规则，却学会了所有的规则。&lt;/strong&gt; 模型在训练中&amp;quot;看&amp;quot;了数万亿字的文本，然后从中&amp;quot;悟&amp;quot;出了语言的规律、世界的规律——但它的大脑里，没有一条&amp;quot;知识&amp;quot;是以&amp;quot;四川的省会是成都&amp;quot;这样的形式存在的。它的知识，全部&amp;quot;融化&amp;quot;在了数千亿个参数中，像水融入了海绵，你挤得出水，但看不到水原本的形状。&lt;/p&gt;&#xA;&lt;p&gt;哲学家Davies在1990年提出了判断一个系统是否拥有内隐知识的三个条件，用这三个条件来检验大模型，你会发现它完美匹配：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一个条件：语义描述。&lt;/strong&gt; 你可以说&amp;quot;这个系统知道地球是圆的&amp;rdquo;，而且这个描述是有意义的——它确实会基于这个&amp;quot;知识&amp;quot;来回答相关问题。但如果你去翻它的参数，你找不到&amp;quot;地球是圆的&amp;quot;这句话存储在哪里。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二个条件：组合性。&lt;/strong&gt; 知识不是孤立的碎片，而是可以组合的。知道&amp;quot;猫是哺乳动物&amp;quot;和&amp;quot;狗是哺乳动物&amp;quot;，就能推出&amp;quot;猫和狗都是哺乳动物&amp;quot;。大模型确实能做到这一点——它不仅能记住学过的知识，还能对知识进行组合、推理、迁移。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第三个条件：因果系统性。&lt;/strong&gt; 知识之间不是孤立的，改变一个知识点会影响其他相关知识。如果你微调模型让它&amp;quot;不承认地球是圆的&amp;quot;，它关于&amp;quot;地月距离&amp;quot;、&amp;ldquo;日食原理&amp;quot;的知识也会随之改变。这就像你改变了一个人的一个信念，他的其他相关信念也会跟着调整——而不是只改一条记录就完事。&lt;/p&gt;&#xA;&lt;p&gt;这三个条件，大模型全都满足。所以，&lt;strong&gt;说大模型拥有内隐知识，不是一种比喻，而是一个有哲学依据的论断。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三章为什么内隐既是力量也是暗箱&#34;&gt;第三章：为什么&amp;quot;内隐&amp;quot;既是力量，也是&amp;quot;暗箱&amp;rdquo;&lt;/h2&gt;&#xA;&lt;p&gt;内隐知识给了大模型一种人类级别的能力——&lt;strong&gt;它不需要规则就能做事。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这就是为什么你不需要教大模型&amp;quot;怎么翻译&amp;quot;——它从大量例子中内化了翻译的能力。你不需要教它&amp;quot;怎么推理&amp;quot;——它从数万亿字的推理文本中内化了推理的&amp;quot;手感&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;但内隐知识也有一个致命的弱点：&lt;strong&gt;你无法直接检查它。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;回想一下前面说的&amp;quot;骑自行车&amp;quot;的例子：你骑得很好，但如果你要教别人骑，你很难说清楚&amp;quot;到底怎么保持平衡&amp;quot;。你只能喊&amp;quot;多练练就习惯了&amp;quot;。这不是因为你不想教，而是因为你的知识本身就是内隐的，你自己也无法把它提取成显式的规则。&lt;/p&gt;&#xA;&lt;p&gt;大模型也面临同样的问题：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;你问它&amp;quot;为什么认为这个答案是对的&amp;quot;，它给出的解释，本质上是在&amp;quot;事后编一个合理的理由&amp;quot;——就像你骑完一段路后，才&amp;quot;编&amp;quot;出一个平衡的力学原理来解释你刚才的动作。这个解释不一定错，但它不是你做动作时实际使用的知识。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;你问它&amp;quot;你还有什么我不知道的知识&amp;quot;，它回答不了——因为它自己也不知道自己&amp;quot;知道&amp;quot;什么。它的知识就像冰山的水下部分——能通过行为表现出来，但无法被直接&amp;quot;盘点&amp;quot;。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;strong&gt;这就是AI的&amp;quot;暗箱&amp;quot;：不是我们故意把AI的知识藏起来，而是AI的知识本身，就是无法被直接提取的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;第四章从编程到教育对齐的内隐转向&#34;&gt;第四章：从&amp;quot;编程&amp;quot;到&amp;quot;教育&amp;quot;——对齐的内隐转向&lt;/h2&gt;&#xA;&lt;p&gt;这个发现，正在改变我们&amp;quot;教AI&amp;quot;的方式。&lt;/p&gt;&#xA;&lt;p&gt;传统的AI对齐思路是&amp;quot;编程式&amp;quot;的：你写规则，模型遵守规则。比如&amp;quot;不要输出有害内容&amp;quot;——这是一条显式规则，你可以在代码里实现它。&lt;/p&gt;&#xA;&lt;p&gt;但对于内隐知识为主的大模型来说，这条路行不通——因为模型的大部分知识不是规则驱动的，而是&amp;quot;感觉&amp;quot;驱动的。你不给它规则，它也能做事；你给它规则，它反而可能&amp;quot;听不懂&amp;quot;——因为规则本身是命题式的，而模型的知识是内隐的。&lt;/p&gt;&#xA;&lt;p&gt;所以，&lt;strong&gt;对齐大模型，更像&amp;quot;教育&amp;quot;而不是&amp;quot;编程&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;想想你怎么教一个孩子&amp;quot;不要撒谎&amp;quot;：你不会只给他一条规则，然后期望他一生遵守。你会给他很多例子——&amp;ldquo;你看，你刚才撒谎了，大家都不开心了&amp;rdquo;——让他从具体的情境中，内化&amp;quot;诚实&amp;quot;这个价值观。&lt;/p&gt;&#xA;&lt;p&gt;大模型的对齐也在走同样的路：通过海量的&amp;quot;好例子&amp;quot;和&amp;quot;坏例子&amp;quot;的对比，通过人类反馈（RLHF）来&amp;quot;塑造&amp;quot;模型的内隐价值观。它不是在学习规则，而是在形成&amp;quot;道德直觉&amp;quot;——就像人类通过教育形成道德感一样。&lt;/p&gt;&#xA;&lt;p&gt;这听起来很先进，但也带来了新的风险：&lt;strong&gt;内隐的知识可能包含我们没有意识到的偏见、错误甚至危险倾向。&lt;/strong&gt; 因为它是&amp;quot;暗箱&amp;quot;式的，我们可能不知道AI到底&amp;quot;知道&amp;quot;什么、&amp;ldquo;相信&amp;quot;什么。你以为它学会了&amp;quot;诚实&amp;rdquo;，它可能学会了&amp;quot;说用户想听的话&amp;quot;——这完全是两回事。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第五章让ai把自己说清楚未来的方向&#34;&gt;第五章：让AI&amp;quot;把自己说清楚&amp;quot;——未来的方向&lt;/h2&gt;&#xA;&lt;p&gt;承认AI的知识是内隐的，并不是终点，而是起点。&lt;/p&gt;&#xA;&lt;p&gt;内隐知识理论指出了AI发展的一个关键方向：&lt;strong&gt;将内隐知识外显化。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果能让AI把它内隐掌握的规律清晰地表达出来，会发生什么？&lt;/p&gt;&#xA;&lt;p&gt;首先，AI会变得更可解释。你不再只是&amp;quot;相信&amp;quot;它的答案，你能理解它为什么这样想——因为它能把自己的内隐推理过程&amp;quot;翻译&amp;quot;成你能理解的逻辑链条。&lt;/p&gt;&#xA;&lt;p&gt;其次，AI可能加速科学发现。想象一下：模型可能已经&amp;quot;感觉&amp;quot;到了某种物理规律，但它不知道如何用数学公式表达。如果能让它把这个内隐的&amp;quot;感觉&amp;quot;外显化，它可能发现人类尚未发现的知识规律。&lt;/p&gt;&#xA;&lt;p&gt;第三，AI的自我提升会变得可控。如果模型能&amp;quot;说出&amp;quot;自己哪里不懂、哪里不确定，我们就可以有针对性地给它补充知识，而不是&amp;quot;盲目&amp;quot;地喂更多数据。&lt;/p&gt;&#xA;&lt;p&gt;当然，这并不容易。内隐知识的外显化，本身就是一个哲学难题——人类研究了半个世纪，也还没完全搞清楚&amp;quot;人是怎么把骑车的感觉说出来的&amp;quot;。但至少，&lt;strong&gt;内隐知识理论给了我们一个正确的框架&lt;/strong&gt;：不是&amp;quot;AI在装傻&amp;quot;，而是&amp;quot;AI的知识就是说不出来&amp;quot;——这是两种完全不同的诊断，也指向了两种完全不同的解决方案。&lt;/p&gt;&#xA;&lt;h2 id=&#34;尾声知识的另一种可能&#34;&gt;尾声：知识的另一种可能&lt;/h2&gt;&#xA;&lt;p&gt;我们习惯了把&amp;quot;知识&amp;quot;等同于&amp;quot;能说出来的东西&amp;quot;——课本里的、试卷上的、论文里的。&lt;/p&gt;&#xA;&lt;p&gt;但波兰尼告诉我们，这只是知识的一种形式。还有另一种知识，它藏在身体里、藏在直觉里、藏在&amp;quot;感觉&amp;quot;里——你用它，但你说不出它。&lt;/p&gt;&#xA;&lt;p&gt;大模型的出现，让我们重新发现了这种知识的价值。它用一种&amp;quot;笨拙但有效&amp;quot;的方式——读遍全人类的文字——学会了我们人类需要几十年才能内化的&amp;quot;语感&amp;quot;和&amp;quot;直觉&amp;quot;。它可能讲不出&amp;quot;为什么&amp;quot;，但它确实&amp;quot;会做&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这或许就是AI最迷人的地方：&lt;strong&gt;它不是一个更聪明的数据库，而是一个拥有了&amp;quot;直觉&amp;quot;的机器。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;而&amp;quot;直觉&amp;quot;这种东西，从来就不是用来解释的——它是用来信任的。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考文献：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;Polanyi, M. (1966). &lt;em&gt;The Tacit Dimension&lt;/em&gt;. University of Chicago Press. &lt;a href=&#34;https://press.uchicago.edu/ucp/books/book/chicago/T/bo6035368.html&#34;&gt;出版社链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Davies, M. (1990). Knowing one&amp;rsquo;s own mind. &lt;em&gt;Proceedings of the Aristotelian Society&lt;/em&gt;, 64, 237-255. &lt;a href=&#34;https://www.jstor.org/stable/4106730&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Brown, T. B., et al. (2020). Language Models are Few-Shot Learners. &lt;em&gt;NeurIPS 2020&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2005.14165&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Bubeck, S., et al. (2023). Sparks of Artificial General Intelligence: Early experiments with GPT-4. &lt;em&gt;arXiv:2303.12712&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2303.12712&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Christiano, P., et al. (2017). Deep Reinforcement Learning from Human Preferences. &lt;em&gt;NeurIPS 2017&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/1706.03741&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. &lt;em&gt;NeurIPS 2022&lt;/em&gt;. &lt;a href=&#34;https://arxiv.org/abs/2203.02155&#34;&gt;论文链接&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ol&gt;</description>
			</item>
	</channel>
</rss>
