引言:一个被误会的"天才"

你可能听过这样的说法:AI之所以会推理,是因为强化学习——就是那个"做对了给奖励、做错了惩罚"的训练方法。

这个故事很符合直觉。像训练宠物一样,AI答对了就给饼干,答错了就挨批评,慢慢地就学会了。听起来完美。

但2026年,IBM的研究团队用500多组对照实验,讲了一个完全不同的故事:

真正教会AI"思考"的,不是强化学习,而是一个大多数人没听过的阶段——中期训练。

强化学习更像是最后的"抛光"环节,而中期训练才是打造推理引擎的那把锤子。没有中期训练,再多的强化学习也很难让AI学会深度推理。

这就像一个被误会的天才——所有人都在夸奖最后的包装,却没人注意到真正让他变强的那段苦修。

什么是中期训练?

要理解中期训练,得先知道AI训练的传统流程。

过去,训练一个大模型分两步走:

第一步:预训练。让模型读互联网上海量的文本——书籍、网页、论文、代码。这一步的目标是让模型"见多识广",学会语言的基本规律。

第二步:后训练(对齐)。通过人工反馈和强化学习,让模型的回答更符合人类期望——更安全、更有用、更听话。

听起来挺完整。但有个问题:经过这两步训练的模型,虽然"知识丰富",但面对需要多步推理的复杂问题时,表现往往很差。

它会"知道",但不会"思考"。

比如你问它一道数学题,它可能直接蹦出一个答案,但这个答案很可能是错的——因为它在模仿"给答案"的模式,而不是在做推理。

中期训练,就是插入在预训练和后训练之间的第三步

预训练(学知识)→ 中期训练(学思考)→ 后训练(学听话)

这个阶段专门用数学题、代码、科学推理等高质量数据来训练模型,目的只有一个:教会模型"如何思考",而不只是"如何回答"。

效果有多惊人?

数据说话。

IBM的研究团队在多个模型上做了500多组对照实验,结果一致得令人震惊:

中期训练让推理能力提升3到4倍。

具体来说,在6个推理基准测试上,经过中期训练的模型比只用强化学习(相同数据)的模型平均高出29到42分。

看一个具体的例子——Granite-3.3-8B模型在数学测试上的表现:

  • 基础模型(只经过预训练):准确率16.9%,回答长度120个字符——基本就是在猜答案
  • 中期训练后:准确率75.5%,回答长度2254个字符——开始一步步推导了
  • 中期训练 + 强化学习:准确率79.5%,回答长度1700个字符——更准、更精炼

注意这里最有意思的变化不只是准确率数字,而是回答长度

从120个字符暴涨到2254个字符——这意味着模型的行为发生了本质变化。它不再"张嘴就答",而是学会了"先想一想再说"。这种"展示思考过程"的能力,恰恰就是思维链推理。

中期训练把一个"猜答案的直觉选手",变成了一个"会推导过程的理性选手"。

为什么强化学习做不到这件事?

很多人会问:既然强化学习这么厉害,为什么不能直接靠它教会AI推理?

IBM的实验揭示了一个关键事实:中期训练和强化学习的运作机制完全不同,彼此不可替代。

打个比方:

  • 中期训练像是给一个人安装了"思考的工具箱"——教他逻辑推理的方法、分解问题的技巧、验证答案的思路。
  • 强化学习像是让这个人在实战中磨练——通过奖惩反馈,优化他的决策质量。

你不能指望一个人通过"实战磨练"就自动学会微积分。他需要先有基础的工具和方法,才能在实践中运用和精进。

实验数据也印证了这一点。只用强化学习训练的模型,推理能力提升有限,而且在训练过程中还会遗忘预训练阶段学到的大量知识。而中期训练不仅大幅提升推理能力,还能很好地保留预训练的知识。

更有趣的是,中期训练的质量决定了强化学习的上限

模型在中期训练阶段把"思考的基础功"打得越扎实,后面强化学习阶段能达到的天花板就越高。反过来,如果跳过中期训练直接上强化学习,就像一个没学过基础理论的人直接去做项目——再怎么磨练也做不出什么名堂。

更令人意外的发现:数据搭配是关键

研究团队还发现,中期训练中用什么数据来训练,效果差异巨大。

不是随便扔一些数学题进去就行。数据混合策略非常关键:

  • 只用数学+代码数据:基础推理能力提升
  • 加入科学推理数据后:推理性能额外显著提升,GPQA-Diamond基准提升了17-28分

这说明中期训练不是简单的"多做做题",而是需要精心设计的"思维营养餐"——不同领域、不同类型的推理数据,能帮模型构建更完整的思维能力。

这件事为什么重要?

对行业的影响

中期训练的发现正在改变AI行业的训练范式。

2026年的前沿模型——包括DeepSeek-R1、Qwen系列、MiMo等——都明确采用了"中期训练"阶段。IBM的Granite 4.2也使用了中期训练来注入推理能力。

更值得关注的是,中期训练的思路正在向更多领域扩展。2026年8月的最新研究(MidTool)表明,中期训练不仅能提升数学和代码推理,还能教会AI如何使用工具——这是智能体(Agent)能力的核心。另一项研究则通过"函数感知填空"的方式进行中期训练,让编程智能体在SWE-Bench上获得了显著提升。

从两阶段到三阶段,不是一点点改进,而是训练范式的结构性升级。

对普通人的启示

如果你是一个AI产品的使用者,中期训练的故事告诉你一件重要的事:

AI的"聪明"不是魔法,也不是一步到位的。它的每一项能力背后,都有专门的训练阶段在支撑。

当一个AI能帮你一步步分析问题时,它不是因为"读了很多书",而是因为在某个训练阶段被专门教会了"如何分析问题"。

这也意味着,如果某个AI在推理上表现不好,问题可能不在于它的"知识不够",而在于它的训练过程中缺少了"学会思考"这一环。

结语:看见"思考"背后的思考

我们这一代人对AI的期待越来越高——我们希望它能推理、能规划、能解决复杂问题。但很少有人想过:这些能力是从哪里来的?

中期训练的故事告诉我们,AI的每一个看似自然的能力,背后都有一个精心设计的训练过程。

推理不是奇迹。它是500多次实验、无数组对照数据、精心调配的数据配方,以及一个被忽视多年的训练阶段共同铸就的结果。

下次当你惊叹于AI的精彩推理时,别忘了——在它"思考"的背后,有一个叫"中期训练"的沉默英雄。


参考文献:

  1. Bharat Runwal et al., “How an extra training step can unlock AI’s reasoning power”, IBM Research, 2026. 研究博客

  2. Fengqing Jiang et al., “MidTool: Mid-training Data Synthesis for Agentic Tool Use”, arXiv:2608.20314, 2026.

  3. Yubo Wang et al., “Function-Aware Fill-in-the-Middle as Mid-training for Coding Agent Foundation Models”, arXiv:2607.12463, 2026.

  4. Jonathan Barnes, “Self-Improving Pretraining as a Substrate for Agentic Post-Training”, 2026. 博客链接