引言
你有没有注意过,最近这一两年,AI回答复杂问题的时候越来越喜欢"先想一想再说"了?
OpenAI的o系列模型会生成几千甚至上万字的"思考过程",然后才给你最终答案。Anthropic的Claude Extended Thinking也是这样——你问它一道数学竞赛题,它先在后台"想"半天,再慢慢把答案写出来。
这就是所谓的"思维链"(Chain of Thought):让AI把推理过程一步步写出来,先"打草稿"再"交作业"。效果确实好,但代价也大——想16步就要花16倍的时间和成本。
一个自然的问题浮出水面:AI能不能像人一样,在心里默默想清楚,然后直接说答案?
2026年,这个问题的答案正在从"不可能"变成"正在实现"。
“必须说出来才能想清楚”——思维链的辉煌与困境
先说说为什么AI需要"把想法说出来"。
2022年,Google Brain的Jason Wei等人发现了一个令人惊讶的现象:当你在提示词里加上"让我们一步一步来想"这句话时,大语言模型在数学题、逻辑推理等任务上的表现会大幅提升。
这就像给学生出了一道难题。直接写答案可能写不对,但如果允许他在草稿纸上演算,正确率就高了很多。
思维链之所以有效,本质原因很简单:它把一个大问题拆成了多个小问题。每一步只需要做一小步推理,降低了每一步的难度,模型就能处理远超其"直觉能力"的复杂任务。
2024年,OpenAI发布了o1——第一个把"长思维链"内化为自身能力的推理模型。它不需要你提示"请一步步想",而是自己就会展开长长的推理链。随后DeepSeek-R1、OpenAI o3、Claude Extended Thinking相继登场,推理模型成为AI行业的新范式。
但问题也随之而来。
慢。 一个复杂的数学问题,模型可能需要生成3000到10000个思考token,耗时30秒到几分钟。在实时对话、游戏AI、自动驾驶等需要快速响应的场景中,这完全不可接受。
贵。 每个思考token都要计费。一个o3的复杂推理调用,成本可能是普通GPT-4调用的10到40倍。
不透明。 有时候你并不想看AI的思考过程——你只想要答案。但在当前架构下,你被迫为那些"中间步骤"买单,不管你是否需要它们。
这就好像一个数学天才每次回答问题都必须在大声自言自语中完成推理——即使他其实可以在心里算出来,系统也强制要求他"说出来"。
隐式思维链:把草稿藏进大脑
2026年5月,UC Berkeley和Princeton大学的一个研究团队——其中包括AI安全领域的重要人物Stuart Russell教授——发表了一篇论文,标题直译为《Transformer可以被证明学会内化思维链》。
他们做了一件此前没有人做到的事:从数学上严格证明了,AI可以在不输出任何中间步骤的情况下,仅凭内部状态完成多步推理。
这个概念叫做"隐式思维链"(Implicit Chain-of-Thought, ICoT)。
核心思想用一个比喻就能说清楚:
显式思维链就像是在黑板上一步步推导数学题——每一步都写出来,所有人都能看到。
隐式思维链则像是一个数学高手在脑子里完成所有推导——外部只看到一个最终答案,但内部的推理质量几乎一样高。
关键问题来了:怎么做到的?
研究团队提出了一个巧妙的训练方法,叫做"树状结构训练法"。
传统方法是"逐步隐藏"——先让模型用完整思维链解题,然后逐步把中间步骤一个接一个地藏起来,强迫模型学会在内部完成那些步骤。问题在于,如果推理链有k步,就需要k个训练阶段,成本随推理长度线性增长。
树状训练法的创新在于:它不是按顺序逐步隐藏,而是按照推理本身的树状结构,从叶到根逐层内化。每一层可以并行训练,训练阶段数从O(k)降到了O(log k)。
这就像教一个学生从"必须大声说出每一步"到"在心里默默思考"——你不是逼他一个步骤一个步骤地内化,而是帮他理解推理的整体结构,让他一次性内化一整层推理。
数据说话:质量与效率的黄金平衡点
理论听起来很美,但实际效果如何?
研究团队在经典的k-奇偶校验问题上做了严格测试。这是一个理论计算机科学中常用的推理难题:给定n个数字,选出k个,判断它们的某种组合结果。
结果非常有说服力:
- 完全不用思维链(直接回答):准确率约50%,基本是猜
- 显式思维链(每步都说出来):准确率约99.5%,但推理成本是16倍
- 隐式思维链(树状训练):准确率约97.6%,推理成本仅1.1倍
换句话说,ICoT牺牲了不到2个百分点的准确率,却换来了接近15倍的效率提升。
在更贴近实际应用的GSM8K数学推理数据集上,效果同样显著:一个经过ICoT蒸馏的70B参数模型,准确率从显式CoT的79.5%只降到77.1%,但推理速度从每秒12个token飙升到每秒35个token,成本降低了约3倍。
这不是一个"理论可行但工程遥远"的结果——它已经接近实用化的门槛。
行业已经在行动
事实上,产业界对"隐式推理"的探索比学术界更加激进。
2026年9月,OpenAI确认了关于GPT-5内部推理机制的泄露信息是真实的。文件显示,GPT-5的推理版本(GPT-5Thinking)使用一种"隐藏思维链"机制——它在内部使用一种抽象的"内部语言"来处理复杂问题,而不是用人类可读的自然语言一步步推理。
OpenAI的发言人这样解释:“这不是漏洞,而是设计。隐藏的思维链允许更高效的推理,而不用中间步骤淹没用户。”
更引人注目的是GPT-6 Astra的表现。有研究者发现,Astra在不使用任何显式思维链的情况下,能够完成需要4到5步"跳跃推理"的复杂问题——而上一代模型GPT-5.6 Sol在同样的条件下几乎完全无法处理。比如,它能回答"哪个化学元素的原子序数等于……(经过三四步地理和人名推理后得出的数字)?“这类问题,准确率高达62%到100%,而前代模型只有0%到30%。
与此同时,学术界的工程化也在加速。2026年9月发表的A*-Thought-V2框架,已经在9B和27B参数的模型上实现了"把冗余推理步骤压缩为隐式向量"的效果——平均准确率提升2.6%,同时回答长度减半,每计算单位的准确率提升了2.29倍。
一个清晰的趋势正在浮现:未来的AI推理模型,可能不再是"慢思考"模式,而是"内隐推理、瞬间输出"的高效模式。
为什么这件事比你想的更重要
隐式思维链的意义远不止"让AI回答更快”。
第一,它改变了推理成本的经济学。 当前推理模型的高成本是限制AI大规模应用的主要瓶颈之一。如果ICoT能将推理成本降低一个数量级,那么AI就能在更多场景中"想"——从手机上的实时翻译,到自动驾驶的即时决策,到智能客服的快速响应。
第二,它可能减少幻觉。 一个有趣的推论是:当模型被迫用自然语言写出每一步推理时,它实际上会被语言的"流畅性"绑架——为了让推理链读起来通顺,它可能在某一步"编造"一个看似合理但实际上错误的中间结论。而隐式推理不经过语言瓶颈,可能在某些情况下反而更"诚实"。
第三,它让AI的推理更接近人类的思维方式。 人类处理复杂问题时,大多数推理是在意识层面之下完成的。你骑自行车时不需要一步步思考平衡的原理,你看一眼就知道对方说的话是什么意思——这些都是"内化"了的推理。AI从"必须说出来"到"可以默默想",是它从"机械计算"走向"类人认知"的一个标志性转变。
第四,也是最深远的:它提出了一个关于"可解释性"的新困境。 如果AI不再输出推理过程,我们怎么知道它的结论是否可靠?在医学诊断、法律判决、金融决策这些需要"说得清道理"的场景中,“AI给出了正确答案但无法解释为什么"是否足够?这是一个技术进步的副产品,也是一个需要全社会讨论的治理问题。
写在最后
从2022年思维链被提出,到2024年推理模型爆发,再到2026年隐式推理的理论与实践同时突破——AI推理能力的演进速度,远比我们想象的快。
也许用不了几年,“AI先想30秒再回答"会变成一种复古的记忆。未来的AI会像一个经验丰富的专家——看一眼问题,心里已经有了答案,然后平静地告诉你结果。
只不过,那个"心里想的过程”,我们可能永远看不到了。
这到底是好事还是坏事?也许两者都是。但至少,我们终于可以说:AI学会了"闷头想”。
来源论文:
- Huang et al., “Transformers Provably Learn to Internalize Chain-of-Thought”, arXiv:2605.28600, 2026年5月, UC Berkeley & Princeton University
- Xu et al., “A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM”, arXiv:2609.07821, 2026年9月
- Wei et al., “Chain-of-Thought Prompting Elicits Reasoning in Large Language Models”, NeurIPS 2022