<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>中期训练 on 灵语AI</title>
		<link>https://lingyu7.com/tags/%E4%B8%AD%E6%9C%9F%E8%AE%AD%E7%BB%83/</link>
		<description>Recent content in 中期训练 on 灵语AI</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Tue, 22 Sep 2026 18:30:00 +0800</lastBuildDate>
		
			<atom:link href="https://lingyu7.com/tags/%E4%B8%AD%E6%9C%9F%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>AI不是天生会思考的——中期训练：让AI从&#39;背答案&#39;到&#39;会推理&#39;的关键一步</title>
				<link>https://lingyu7.com/posts/ai-mid-training-how-ai-learns-to-think/</link>
				<pubDate>Tue, 22 Sep 2026 18:30:00 +0800</pubDate>
				<guid>https://lingyu7.com/posts/ai-mid-training-how-ai-learns-to-think/</guid>
				<description>&lt;h2 id=&#34;引言一个被误会的天才&#34;&gt;引言：一个被误会的&amp;quot;天才&amp;quot;&lt;/h2&gt;&#xA;&lt;p&gt;你可能听过这样的说法：AI之所以会推理，是因为强化学习——就是那个&amp;quot;做对了给奖励、做错了惩罚&amp;quot;的训练方法。&lt;/p&gt;&#xA;&lt;p&gt;这个故事很符合直觉。像训练宠物一样，AI答对了就给饼干，答错了就挨批评，慢慢地就学会了。听起来完美。&lt;/p&gt;&#xA;&lt;p&gt;但2026年，IBM的研究团队用500多组对照实验，讲了一个完全不同的故事：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真正教会AI&amp;quot;思考&amp;quot;的，不是强化学习，而是一个大多数人没听过的阶段——中期训练。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;强化学习更像是最后的&amp;quot;抛光&amp;quot;环节，而中期训练才是打造推理引擎的那把锤子。没有中期训练，再多的强化学习也很难让AI学会深度推理。&lt;/p&gt;&#xA;&lt;p&gt;这就像一个被误会的天才——所有人都在夸奖最后的包装，却没人注意到真正让他变强的那段苦修。&lt;/p&gt;&#xA;&lt;h2 id=&#34;什么是中期训练&#34;&gt;什么是中期训练？&lt;/h2&gt;&#xA;&lt;p&gt;要理解中期训练，得先知道AI训练的传统流程。&lt;/p&gt;&#xA;&lt;p&gt;过去，训练一个大模型分两步走：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一步：预训练&lt;/strong&gt;。让模型读互联网上海量的文本——书籍、网页、论文、代码。这一步的目标是让模型&amp;quot;见多识广&amp;quot;，学会语言的基本规律。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二步：后训练（对齐）&lt;/strong&gt;。通过人工反馈和强化学习，让模型的回答更符合人类期望——更安全、更有用、更听话。&lt;/p&gt;&#xA;&lt;p&gt;听起来挺完整。但有个问题：经过这两步训练的模型，虽然&amp;quot;知识丰富&amp;quot;，但面对需要多步推理的复杂问题时，表现往往很差。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;它会&amp;quot;知道&amp;quot;，但不会&amp;quot;思考&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;比如你问它一道数学题，它可能直接蹦出一个答案，但这个答案很可能是错的——因为它在模仿&amp;quot;给答案&amp;quot;的模式，而不是在做推理。&lt;/p&gt;&#xA;&lt;p&gt;中期训练，就是插入在预训练和后训练之间的&lt;strong&gt;第三步&lt;/strong&gt;：&lt;/p&gt;&#xA;&lt;div class=&#34;code-block&#34;&gt;&#xA;    &lt;button class=&#34;code-copy&#34; type=&#34;button&#34; hidden aria-label=&#34;Copy code to clipboard&#34;&gt;&#xA;      &lt;span class=&#34;code-copy-label&#34; aria-hidden=&#34;true&#34;&gt;Copy&lt;/span&gt;&#xA;    &lt;/button&gt;&#xA;    &lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;预训练（学知识）→ 中期训练（学思考）→ 后训练（学听话）&lt;/code&gt;&lt;/pre&gt;&#xA;  &lt;/div&gt;&lt;p&gt;这个阶段专门用数学题、代码、科学推理等高质量数据来训练模型，目的只有一个：&lt;strong&gt;教会模型&amp;quot;如何思考&amp;quot;，而不只是&amp;quot;如何回答&amp;quot;。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;效果有多惊人&#34;&gt;效果有多惊人？&lt;/h2&gt;&#xA;&lt;p&gt;数据说话。&lt;/p&gt;&#xA;&lt;p&gt;IBM的研究团队在多个模型上做了500多组对照实验，结果一致得令人震惊：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;中期训练让推理能力提升3到4倍。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;具体来说，在6个推理基准测试上，经过中期训练的模型比只用强化学习（相同数据）的模型平均高出29到42分。&lt;/p&gt;&#xA;&lt;p&gt;看一个具体的例子——Granite-3.3-8B模型在数学测试上的表现：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;基础模型&lt;/strong&gt;（只经过预训练）：准确率16.9%，回答长度120个字符——基本就是在猜答案&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练后&lt;/strong&gt;：准确率75.5%，回答长度2254个字符——开始一步步推导了&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练 + 强化学习&lt;/strong&gt;：准确率79.5%，回答长度1700个字符——更准、更精炼&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;注意这里最有意思的变化不只是准确率数字，而是&lt;strong&gt;回答长度&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;从120个字符暴涨到2254个字符——这意味着模型的行为发生了本质变化。它不再&amp;quot;张嘴就答&amp;quot;，而是学会了&amp;quot;先想一想再说&amp;quot;。这种&amp;quot;展示思考过程&amp;quot;的能力，恰恰就是思维链推理。&lt;/p&gt;&#xA;&lt;p&gt;中期训练把一个&amp;quot;猜答案的直觉选手&amp;quot;，变成了一个&amp;quot;会推导过程的理性选手&amp;quot;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么强化学习做不到这件事&#34;&gt;为什么强化学习做不到这件事？&lt;/h2&gt;&#xA;&lt;p&gt;很多人会问：既然强化学习这么厉害，为什么不能直接靠它教会AI推理？&lt;/p&gt;&#xA;&lt;p&gt;IBM的实验揭示了一个关键事实：&lt;strong&gt;中期训练和强化学习的运作机制完全不同，彼此不可替代。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;打个比方：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;中期训练&lt;/strong&gt;像是给一个人安装了&amp;quot;思考的工具箱&amp;quot;——教他逻辑推理的方法、分解问题的技巧、验证答案的思路。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;强化学习&lt;/strong&gt;像是让这个人在实战中磨练——通过奖惩反馈，优化他的决策质量。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;你不能指望一个人通过&amp;quot;实战磨练&amp;quot;就自动学会微积分。他需要先有基础的工具和方法，才能在实践中运用和精进。&lt;/p&gt;&#xA;&lt;p&gt;实验数据也印证了这一点。只用强化学习训练的模型，推理能力提升有限，而且在训练过程中还会遗忘预训练阶段学到的大量知识。而中期训练不仅大幅提升推理能力，还能很好地保留预训练的知识。&lt;/p&gt;&#xA;&lt;p&gt;更有趣的是，&lt;strong&gt;中期训练的质量决定了强化学习的上限&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;模型在中期训练阶段把&amp;quot;思考的基础功&amp;quot;打得越扎实，后面强化学习阶段能达到的天花板就越高。反过来，如果跳过中期训练直接上强化学习，就像一个没学过基础理论的人直接去做项目——再怎么磨练也做不出什么名堂。&lt;/p&gt;&#xA;&lt;h2 id=&#34;更令人意外的发现数据搭配是关键&#34;&gt;更令人意外的发现：数据搭配是关键&lt;/h2&gt;&#xA;&lt;p&gt;研究团队还发现，中期训练中&lt;strong&gt;用什么数据来训练&lt;/strong&gt;，效果差异巨大。&lt;/p&gt;&#xA;&lt;p&gt;不是随便扔一些数学题进去就行。数据混合策略非常关键：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;只用数学+代码数据：基础推理能力提升&lt;/li&gt;&#xA;&lt;li&gt;加入科学推理数据后：推理性能额外显著提升，GPQA-Diamond基准提升了17-28分&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这说明中期训练不是简单的&amp;quot;多做做题&amp;quot;，而是需要精心设计的&amp;quot;思维营养餐&amp;quot;——不同领域、不同类型的推理数据，能帮模型构建更完整的思维能力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;这件事为什么重要&#34;&gt;这件事为什么重要？&lt;/h2&gt;&#xA;&lt;h3 id=&#34;对行业的影响&#34;&gt;对行业的影响&lt;/h3&gt;&#xA;&lt;p&gt;中期训练的发现正在改变AI行业的训练范式。&lt;/p&gt;&#xA;&lt;p&gt;2026年的前沿模型——包括DeepSeek-R1、Qwen系列、MiMo等——都明确采用了&amp;quot;中期训练&amp;quot;阶段。IBM的Granite 4.2也使用了中期训练来注入推理能力。&lt;/p&gt;&#xA;&lt;p&gt;更值得关注的是，中期训练的思路正在向更多领域扩展。2026年8月的最新研究（MidTool）表明，中期训练不仅能提升数学和代码推理，还能教会AI&lt;strong&gt;如何使用工具&lt;/strong&gt;——这是智能体（Agent）能力的核心。另一项研究则通过&amp;quot;函数感知填空&amp;quot;的方式进行中期训练，让编程智能体在SWE-Bench上获得了显著提升。&lt;/p&gt;&#xA;&lt;p&gt;从两阶段到三阶段，不是一点点改进，而是训练范式的结构性升级。&lt;/p&gt;&#xA;&lt;h3 id=&#34;对普通人的启示&#34;&gt;对普通人的启示&lt;/h3&gt;&#xA;&lt;p&gt;如果你是一个AI产品的使用者，中期训练的故事告诉你一件重要的事：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;AI的&amp;quot;聪明&amp;quot;不是魔法，也不是一步到位的。它的每一项能力背后，都有专门的训练阶段在支撑。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;当一个AI能帮你一步步分析问题时，它不是因为&amp;quot;读了很多书&amp;quot;，而是因为在某个训练阶段被专门教会了&amp;quot;如何分析问题&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;这也意味着，如果某个AI在推理上表现不好，问题可能不在于它的&amp;quot;知识不够&amp;quot;，而在于它的训练过程中缺少了&amp;quot;学会思考&amp;quot;这一环。&lt;/p&gt;&#xA;&lt;h2 id=&#34;结语看见思考背后的思考&#34;&gt;结语：看见&amp;quot;思考&amp;quot;背后的思考&lt;/h2&gt;&#xA;&lt;p&gt;我们这一代人对AI的期待越来越高——我们希望它能推理、能规划、能解决复杂问题。但很少有人想过：这些能力是从哪里来的？&lt;/p&gt;&#xA;&lt;p&gt;中期训练的故事告诉我们，&lt;strong&gt;AI的每一个看似自然的能力，背后都有一个精心设计的训练过程。&lt;/strong&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
