引言
你可能已经习惯了这样的叙事:AI越来越会“思考”了。
从2024年OpenAI发布o1开始,一种叫“推理模型”的AI成了热门话题。和传统 AI“脱口而出”答案不同,推理模型会先在内部“想”一大段推理过程,再给出最终答案。这种技术叫“测试时计算”(Test-Time Compute)——简单说,就是让AI在回答问题时花更多时间去“想”。
效果确实惊艳。在数学竞赛、代码编程、科学推理这些需要深度思考的任务上,推理模型的表现远超传统模型。OpenAI o3甚至在抽象推理测试中接近了人类顶尖水平。
于是一个直觉性的结论似乎水到渠成:让AI想得更久,就能答得更好。
但2026年的最新研究告诉我们——这个结论只对了一半。在某些场景下,让AI想得更久,不仅不会更好,反而会制造出更自信的错误答案。
“想多了”反而出错:知识密集型任务的陷阱
想象你在参加一场闭卷考试。
如果你不确定答案,你会怎么做?一种策略是反复回忆、反复推敲,试图从记忆深处“挖”出正确答案。这听起来很合理——多想想嘛,说不定就想起来了。
但心理学研究早就发现了一个现象:确认偏误(Confirmation Bias)。一旦你的大脑模糊地形成了一个“初步印象”,后续的回忆过程会不自觉地去“支持”这个印象,而不是客观地检验它。你会想起“支持”这个印象的“证据”,甚至不自觉地编造出一些看似合理但实际上并不存在的细节。
2026年的研究发现,AI推理模型在面对知识密集型任务时,会出现几乎一模一样的问题。
这篇来自学术界的研究评估了14个推理模型在不同测试时计算策略下的表现。结果令人意外:增加推理时间并没有持续提升准确率,在不少情况下反而增加了幻觉(hallucination)的比例。
所谓“幻觉”,就是AI一本正经地编造事实。而更令人不安的是,AI想的时间越长,它编造的“细节”就越丰富,对自己的错误答案就越自信。
AI是怎么“编故事”的?
让我用一个具体例子来说明。
假设你问一个推理模型:“某某学者是哪一年获得AAAI杰出论文奖的?”
模型不确定。如果用普通模式,它可能直接说“我不确定”。但如果开了“深度思考”模式,事情就变得有意思了:
低思考量时: “嗯……可能是2005年?不太确定。”
高思考量时: “让我仔细想想……应该是2005年左右。我记得AAAI的官网上有获奖名单……这位学者在自然语言处理领域有很多贡献……对,可以确认是2005年。我相当确定。”
看到了吗?高思考量的版本并没有给出更准确的答案——答案依然是错的。但它多了一堆“支撑细节”,这些细节看起来合情合理,实际上全是编造的。
研究团队发现了一个惊人的规律:随着推理时间的增加,错误答案在推理过程中出现的位置越来越靠前。在SimpleQA基准测试上,错误答案首次出现的位置从推理过程的45.7%处(差不多中间位置)提前到了17.2%处(非常靠前)。
这意味着什么?AI在推理的早期就“猜”了一个错误答案,然后剩下的推理过程不是在寻找真相,而是在为这个错误答案找理由。
这就是AI版本的确认偏误。
为什么会这样?一个信息论的解释
为什么“想更多”不能解决这个问题?研究者从信息论的角度给出了一个根本性的解释。
知识密集型任务本质上要求AI从自己的“记忆”(也就是模型参数)中回忆特定的事实。比如某个人的生日、某篇论文的发表年份、某个化学反应的条件——这些信息无法通过逻辑推理“推导”出来,只能靠“记住”。
而测试时计算,无论多么复杂,本质上都是在一个固定模型上做后处理。它不能给模型注入新的信息。如果模型的参数中根本没有存储某个事实的准确信息,再多的推理也“推”不出来。
打个比方:这就像让一个人闭卷考试,然后告诉他“你可以多想想”。如果他的脑子里根本没记住这个知识点,想再久也只能是“猜”,而“猜”的过程会被各种认知偏差所污染。
研究者证明了一个信息论上界:在信息有限的情况下,纯粹依靠测试时计算的性能存在一个不可突破的天花板。
那“测试时计算”到底行不行?
说了这么多问题,公平起见,需要澄清一下:测试时计算并非一无是处。
在数学推理、代码调试、逻辑推导这类任务上,测试时计算确实非常有效。因为这些任务的特点是可以“推”出来的——即使你不记得某个中间步骤,你可以通过逻辑重新推导。在这类任务上,更多的思考时间确实能带来更好的表现。
问题出在任务类型的错配上。当任务需要的是“记住一个事实”而不是“推导一个结论”时,更多的思考时间不仅没用,还有害。
这就引出了一个非常重要的实践启示:不是所有问题都适合让AI“深度思考”。
对于简单的事实查询——比如“某公司CEO是谁”“某个历史事件发生在哪一年”——直接用普通模型快速回答,往往比让推理模型“想半天”更可靠。推理模型的优势领域是需要多步推理的复杂问题,而不是需要精确记忆的知识点。
更深层的启示:AI“过度自信”的危险
这个发现还有一个更深层的意义。
我们都知道AI会产生幻觉,但之前的理解是:AI“不知道就说不知道”的问题可以通过更好的训练来解决。而这个研究揭示了一个更隐蔽的风险——AI可以在“思考”的过程中,把自己的幻觉“合理化”。
当AI花了大量推理token去“论证”一个错误答案时,它最终呈现出来的不仅是错误的结论,还有一个看起来逻辑自洽的“推理过程”。这让错误变得更难被识别——因为人类天然倾向于信任“有理有据”的说法。
这和我们日常生活中遇到的“自信的错误”如出一辙。那些最危险的错误信息,往往不是信口开河的胡说,而是包装精美、论据“充分”的系统性误导。AI的“过度思考”幻觉,恰好具备这个特征。
出路在哪里?
研究者们也在探索解决方案。几个值得关注的方向:
检索增强推理(Retrieval-Augmented Reasoning):与其让AI凭空“回忆”,不如在推理过程中给它提供外部参考资料。2026年8月发表的ThinkRetrieve框架就是这样一个思路——在推理的每一步都注入相关的已解决问题示例,让AI不用孤军奋战。在竞赛数学上,这带来了高达60%的相对提升。
自适应计算分配:与其对所有问题都投入大量思考时间,不如先判断问题的难度和类型,对简单问题“快思考”,对复杂问题“慢思考”。2026年的多项研究都在探索这个方向。
并行思考策略:不走“一条路走到黑”的单线推理,而是同时生成多条独立的推理路径,然后通过投票等方式选出最可靠的答案。研究表明,这种“群体智慧”策略在很多场景下优于单一长推理链。
写在最后
“让AI想得更久”是一个优雅的想法,但它不是万能的。就像人类一样,AI的“思考”也有其边界和盲区。知道什么时候该深入思考、什么时候该承认不知道,才是真正智慧的标志——无论对碳基生命还是硅基智能来说,都是如此。
下次你看到AI给你一段很长很详细的回答时,不妨多想一想:这些“证据”是真的,还是AI“想太多”之后编出来的故事?
参考来源:
-
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet (2026) - arxiv.org/abs/2509.06861
-
ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling (2026) - arxiv.org/abs/2608.10928
-
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility (2026) - arxiv.org/abs/2608.04001
-
Rethinking Inference-Time Scaling: Efficiency Limits and Linguistic Signals (2026) - arxiv.org/abs/2504.14047