<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>测试时计算 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E6%B5%8B%E8%AF%95%E6%97%B6%E8%AE%A1%E7%AE%97/</link>
		<description>Recent content in 测试时计算 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 24 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E6%B5%8B%E8%AF%95%E6%97%B6%E8%AE%A1%E7%AE%97/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI想多了也会“翻车”——测试时计算为何会制造更自信的幻觉？</title>
				<link>https://lingyu7.com/posts/ai-test-time-scaling-hallucination-trap/</link>
				<pubDate>Thu, 24 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-test-time-scaling-hallucination-trap/</guid>
				<description>&lt;h2 id=&#34;引言&#34;&gt;引言&lt;/h2&gt;&#xA;&lt;p&gt;你可能已经习惯了这样的叙事：AI越来越会“思考”了。&lt;/p&gt;&#xA;&lt;p&gt;从2024年OpenAI发布o1开始，一种叫“推理模型”的AI成了热门话题。和传统 AI“脱口而出”答案不同，推理模型会先在内部“想”一大段推理过程，再给出最终答案。这种技术叫“测试时计算”（Test-Time Compute）——简单说，就是让AI在回答问题时花更多时间去“想”。&lt;/p&gt;&#xA;&lt;p&gt;效果确实惊艳。在数学竞赛、代码编程、科学推理这些需要深度思考的任务上，推理模型的表现远超传统模型。OpenAI o3甚至在抽象推理测试中接近了人类顶尖水平。&lt;/p&gt;&#xA;&lt;p&gt;于是一个直觉性的结论似乎水到渠成：&lt;strong&gt;让AI想得更久，就能答得更好。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;但2026年的最新研究告诉我们——这个结论只对了一半。在某些场景下，让AI想得更久，不仅不会更好，反而会制造出更自信的&lt;strong&gt;错误答案&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;想多了反而出错知识密集型任务的陷阱&#34;&gt;“想多了”反而出错：知识密集型任务的陷阱&lt;/h2&gt;&#xA;&lt;p&gt;想象你在参加一场闭卷考试。&lt;/p&gt;&#xA;&lt;p&gt;如果你不确定答案，你会怎么做？一种策略是反复回忆、反复推敲，试图从记忆深处“挖”出正确答案。这听起来很合理——多想想嘛，说不定就想起来了。&lt;/p&gt;&#xA;&lt;p&gt;但心理学研究早就发现了一个现象：&lt;strong&gt;确认偏误&lt;/strong&gt;（Confirmation Bias）。一旦你的大脑模糊地形成了一个“初步印象”，后续的回忆过程会不自觉地去“支持”这个印象，而不是客观地检验它。你会想起“支持”这个印象的“证据”，甚至不自觉地&lt;strong&gt;编造&lt;/strong&gt;出一些看似合理但实际上并不存在的细节。&lt;/p&gt;&#xA;&lt;p&gt;2026年的研究发现，AI推理模型在面对知识密集型任务时，会出现几乎一模一样的问题。&lt;/p&gt;&#xA;&lt;p&gt;这篇来自学术界的研究评估了14个推理模型在不同测试时计算策略下的表现。结果令人意外：&lt;strong&gt;增加推理时间并没有持续提升准确率，在不少情况下反而增加了幻觉（hallucination）的比例。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;所谓“幻觉”，就是AI一本正经地编造事实。而更令人不安的是，AI想的时间越长，它编造的“细节”就越丰富，对自己的错误答案就越&lt;strong&gt;自信&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;ai是怎么编故事的&#34;&gt;AI是怎么“编故事”的？&lt;/h2&gt;&#xA;&lt;p&gt;让我用一个具体例子来说明。&lt;/p&gt;&#xA;&lt;p&gt;假设你问一个推理模型：“某某学者是哪一年获得AAAI杰出论文奖的？”&lt;/p&gt;&#xA;&lt;p&gt;模型不确定。如果用普通模式，它可能直接说“我不确定”。但如果开了“深度思考”模式，事情就变得有意思了：&lt;/p&gt;&#xA;&lt;blockquote&gt;&#xA;&lt;p&gt;&lt;strong&gt;低思考量时：&lt;/strong&gt;&#xA;“嗯……可能是2005年？不太确定。”&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;高思考量时：&lt;/strong&gt;&#xA;“让我仔细想想……应该是2005年左右。我记得AAAI的官网上有获奖名单……这位学者在自然语言处理领域有很多贡献……对，可以确认是2005年。我相当确定。”&lt;/p&gt;&#xA;&lt;/blockquote&gt;&#xA;&lt;p&gt;看到了吗？高思考量的版本并没有给出更准确的答案——答案依然是错的。但它多了一堆“支撑细节”，这些细节看起来合情合理，实际上全是&lt;strong&gt;编造&lt;/strong&gt;的。&lt;/p&gt;&#xA;&lt;p&gt;研究团队发现了一个惊人的规律：随着推理时间的增加，&lt;strong&gt;错误答案在推理过程中出现的位置越来越靠前&lt;/strong&gt;。在SimpleQA基准测试上，错误答案首次出现的位置从推理过程的45.7%处（差不多中间位置）提前到了17.2%处（非常靠前）。&lt;/p&gt;&#xA;&lt;p&gt;这意味着什么？AI在推理的早期就“猜”了一个错误答案，然后剩下的推理过程不是在寻找真相，而是在&lt;strong&gt;为这个错误答案找理由&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;这就是AI版本的确认偏误。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么会这样一个信息论的解释&#34;&gt;为什么会这样？一个信息论的解释&lt;/h2&gt;&#xA;&lt;p&gt;为什么“想更多”不能解决这个问题？研究者从信息论的角度给出了一个根本性的解释。&lt;/p&gt;&#xA;&lt;p&gt;知识密集型任务本质上要求AI从自己的“记忆”（也就是模型参数）中&lt;strong&gt;回忆&lt;/strong&gt;特定的事实。比如某个人的生日、某篇论文的发表年份、某个化学反应的条件——这些信息无法通过逻辑推理“推导”出来，只能靠“记住”。&lt;/p&gt;&#xA;&lt;p&gt;而测试时计算，无论多么复杂，本质上都是在一个&lt;strong&gt;固定模型&lt;/strong&gt;上做后处理。它不能给模型注入新的信息。如果模型的参数中根本没有存储某个事实的准确信息，再多的推理也“推”不出来。&lt;/p&gt;&#xA;&lt;p&gt;打个比方：这就像让一个人闭卷考试，然后告诉他“你可以多想想”。如果他的脑子里根本没记住这个知识点，想再久也只能是“猜”，而“猜”的过程会被各种认知偏差所污染。&lt;/p&gt;&#xA;&lt;p&gt;研究者证明了一个信息论上界：&lt;strong&gt;在信息有限的情况下，纯粹依靠测试时计算的性能存在一个不可突破的天花板。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;那测试时计算到底行不行&#34;&gt;那“测试时计算”到底行不行？&lt;/h2&gt;&#xA;&lt;p&gt;说了这么多问题，公平起见，需要澄清一下：测试时计算并非一无是处。&lt;/p&gt;&#xA;&lt;p&gt;在&lt;strong&gt;数学推理、代码调试、逻辑推导&lt;/strong&gt;这类任务上，测试时计算确实非常有效。因为这些任务的特点是可以“推”出来的——即使你不记得某个中间步骤，你可以通过逻辑重新推导。在这类任务上，更多的思考时间确实能带来更好的表现。&lt;/p&gt;&#xA;&lt;p&gt;问题出在&lt;strong&gt;任务类型的错配&lt;/strong&gt;上。当任务需要的是“记住一个事实”而不是“推导一个结论”时，更多的思考时间不仅没用，还有害。&lt;/p&gt;&#xA;&lt;p&gt;这就引出了一个非常重要的实践启示：&lt;strong&gt;不是所有问题都适合让AI“深度思考”。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;对于简单的事实查询——比如“某公司CEO是谁”“某个历史事件发生在哪一年”——直接用普通模型快速回答，往往比让推理模型“想半天”更可靠。推理模型的优势领域是需要多步推理的复杂问题，而不是需要精确记忆的知识点。&lt;/p&gt;&#xA;&lt;h2 id=&#34;更深层的启示ai过度自信的危险&#34;&gt;更深层的启示：AI“过度自信”的危险&lt;/h2&gt;&#xA;&lt;p&gt;这个发现还有一个更深层的意义。&lt;/p&gt;&#xA;&lt;p&gt;我们都知道AI会产生幻觉，但之前的理解是：AI“不知道就说不知道”的问题可以通过更好的训练来解决。而这个研究揭示了一个更隐蔽的风险——&lt;strong&gt;AI可以在“思考”的过程中，把自己的幻觉“合理化”。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当AI花了大量推理token去“论证”一个错误答案时，它最终呈现出来的不仅是错误的结论，还有一个看起来逻辑自洽的“推理过程”。这让错误变得更难被识别——因为人类天然倾向于信任“有理有据”的说法。&lt;/p&gt;&#xA;&lt;p&gt;这和我们日常生活中遇到的“自信的错误”如出一辙。那些最危险的错误信息，往往不是信口开河的胡说，而是包装精美、论据“充分”的系统性误导。AI的“过度思考”幻觉，恰好具备这个特征。&lt;/p&gt;&#xA;&lt;h2 id=&#34;出路在哪里&#34;&gt;出路在哪里？&lt;/h2&gt;&#xA;&lt;p&gt;研究者们也在探索解决方案。几个值得关注的方向：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;检索增强推理&lt;/strong&gt;（Retrieval-Augmented Reasoning）：与其让AI凭空“回忆”，不如在推理过程中给它提供外部参考资料。2026年8月发表的ThinkRetrieve框架就是这样一个思路——在推理的每一步都注入相关的已解决问题示例，让AI不用孤军奋战。在竞赛数学上，这带来了高达60%的相对提升。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;自适应计算分配&lt;/strong&gt;：与其对所有问题都投入大量思考时间，不如先判断问题的难度和类型，对简单问题“快思考”，对复杂问题“慢思考”。2026年的多项研究都在探索这个方向。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;并行思考策略&lt;/strong&gt;：不走“一条路走到黑”的单线推理，而是同时生成多条独立的推理路径，然后通过投票等方式选出最可靠的答案。研究表明，这种“群体智慧”策略在很多场景下优于单一长推理链。&lt;/p&gt;&#xA;&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;&#xA;&lt;p&gt;“让AI想得更久”是一个优雅的想法，但它不是万能的。就像人类一样，AI的“思考”也有其边界和盲区。知道什么时候该深入思考、什么时候该承认不知道，才是真正智慧的标志——无论对碳基生命还是硅基智能来说，都是如此。&lt;/p&gt;&#xA;&lt;p&gt;下次你看到AI给你一段很长很详细的回答时，不妨多想一想：这些“证据”是真的，还是AI“想太多”之后编出来的故事？&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;p&gt;&lt;strong&gt;参考来源：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;em&gt;Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet&lt;/em&gt; (2026) - &lt;a href=&#34;https://arxiv.org/abs/2509.06861&#34;&gt;arxiv.org/abs/2509.06861&lt;/a&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
