引言
你可能已经习惯了这样使用ChatGPT:
“帮我翻译以下内容,风格参照:‘今天天气真好’→‘What a beautiful day’;‘晚饭吃了火锅’→‘Had hotpot for dinner’。现在翻译:‘周末去了趟故宫’。”
AI会立刻输出:“Visited the Forbidden City on the weekend.”
你觉得这很正常。但仔细想想,这件事其实非常不可思议——你没有教它任何东西,没有训练,没有更新参数,只是给了两个例子,它就好像"学会"了一种新的翻译风格,完美地应用到了第三句。
这种能力叫做上下文学习(In-Context Learning,简称ICL),是大语言模型最接近"魔法"的能力之一。
什么是上下文学习
用一个生活类比来说明。
假设你是一位翻译官,某天客户给你一份文档,开头附了两段参考译文,告诉你"请用这种风格翻"。你看完参考后,立刻理解了——也许是口语化的,也许是文言味的。然后你开始翻译后续内容,风格完全对齐。
你没有变成"新的人",你的翻译能力没有本质改变,但你根据上下文中提供的少量示例,临时调整了自己的输出方式。
大语言模型做的事情本质上和你一样。上下文学习的核心特征是不更新任何参数:模型的权重从训练完成那一刻起就固定了,但每次你给它新的上下文——几个示例、一段说明、一种格式——它都能在不"重新学习"的情况下表现得好像学到了新技能。
这个能力什么时候被发现
严格来说,上下文学习是2020年GPT-3论文中被正式命名的。当时OpenAI的研究人员发现一个有趣的现象:随着模型变大,它们开始展现出一种训练目标中没有明确要求的能力——只看几个示例就能完成新任务。
GPT-3的训练目标很简单:给定前面的文字,预测下一个词。研究人员并没有显式地教它"翻译"“分类"“做数学”,但当模型足够大时,它竟然能通过这些简单示例推断出任务规则。
更让人吃惊的是,模型越大,上下文学习的效果越好。一个1750亿参数的GPT-3,给几个示例就能完成翻译、情感分析、新闻分类等任务,效果堪比专门训练的小模型。
从那时候起,研究者们就开始追问:这个能力到底是怎么回事?
最新发现:AI内部在构建"信念”
2026年9月15日发表的论文《Large Language Models Develop Belief State Geometry In-Context》(arXiv:2609.17376)给出了一个令人兴奋的答案。
研究者设计了一个巧妙的实验:他们让大模型阅读由隐马尔可夫模型(HMM)生成的序列数据。你可以把这理解为一种"有隐藏规律的密码序列"——表面上看到的是一串符号,但背后有一套隐藏的状态机在控制符号的生成。
然后他们在模型内部探测一个关键指标:“信念状态”——也就是模型在看到当前所有符号后,对隐藏状态的概率推断。这就像你看了一段密码后,心里对"下一个符号可能是什么"的判断。
结果非常惊人:在6个开源大模型、40个不同的隐马尔可夫模型上,模型内部激活值的几何结构与贝叶斯最优信念状态的几何结构高度吻合,R²值达到了0.83到0.99。
换句话说,模型在"看"示例的过程中,内部真的在构建一个精确的概率推理引擎。它不是在死记硬背示例的模式,而是在推断示例背后的隐藏规律,然后用这个规律去预测下一步。
研究者还做了一个"手术":直接修改模型内部那个与信念状态对应的子空间。结果模型的预测能力大幅下降。这证明那个子空间不是无关的旁支信号,而是上下文学习的功能核心。
另一面:它可能不是"真正的推理"
但几乎同时发表的另一篇论文,给这个乐观图景泼了一盆冷水。
《Recursive Reasoning or Statistical Extrapolation?》(arXiv:2609.18591)提出了一个尖锐的问题:上下文学习到底是在做深层推理,还是只是在统计模式上做外推?
研究者设计了一个多人博弈实验——让多个AI在不完整信息的博弈场景中做决策。这种场景需要"递归推理":我需要猜你在想什么,你在猜我在想什么,我在猜你猜我在想什么……这是真正需要"理解对方心理"的场景。
然后他们做了一个关键的操作:打乱历史数据的统计规律,让"过去的数据分布"和"未来的数据分布"不再一致。
结果发现:当统计规律被打乱后,更长的上下文带来的好处几乎完全消失了。AI的表现退化到和没有上下文时一样。而且博弈中的策略依赖越强——也就是越需要理解对方心理的时候——这种退化越严重。
结论很清楚:在这类需要深层推理的场景中,上下文学习更像是在做统计模式外推,而不是真正的策略推理。
两篇论文拼出完整图景
把这两篇论文放在一起看,一幅更完整的图浮现出来:
上下文学习的本质,是一种高度精密的"快速适应"机制,但它不是万能的。
它厉害的地方在于:
- 对于模式清晰、规律可循的任务(翻译风格、格式转换、分类规则),模型能迅速从少量示例中提取规律,效果接近统计学上的最优解
- 这种能力不是"临时学会"的,而是在海量预训练数据中"预埋"的——模型见过无数种模式匹配场景,以至于它学会了一种通用的"看示例找规律"的元能力
它的天花板在于:
- 对于需要深层因果推理、多方博弈、长链逻辑推演的任务,上下文学习的"统计外推"本质就暴露了
- 示例的质量至关重要。如果示例带有误导性模式,模型会忠实地外推错误模式
- 它擅长的是"从模式到模式"的映射,而不是"从零到一"的推理
怎么更好地利用这个能力
理解了上下文学习的机制和边界,你可以更聪明地使用AI:
1. 示例越精准,效果越好。 不要只给模糊的指令。给模型2~3个你期望的输出示例,比写一大段"我希望你这样做"的描述效果好得多。模型在上下文学习中,对"模式"的提取能力远强于对自然语言指令的理解能力。
2. 复杂任务别指望"看一眼就会"。 需要深层推理的任务(数学证明、多步逻辑推演),光给示例不够。你需要配合"思维链"——让模型一步步想,而不是一眼看答案。
3. 警惕"伪学习"。 当AI根据几个示例给出"正确"回答时,别急着说"它学会了"。换一组统计分布不同的测试用例,表现可能完全不同。上下文学习的泛化能力有明确边界。
写在最后
从"AI看几个例子就会了"到"AI在内部构建贝叶斯信念状态",再到"但这可能不是真正的推理而是统计外推"——2026年的最新研究正在帮我们把这个"魔法"拆解成可理解的科学。
这不妨碍我们继续惊叹于大模型的强大。但理解边界,才能更精确地使用它。知道一把锤子能钉什么钉子、不能钉什么钉子,才是真正用好锤子的前提。
参考文献:
-
Balcells, D., Lee, A.J., Rastogi, C., Riechers, P.M., Shai, A., & Poncini, X. (2026). Large Language Models Develop Belief State Geometry In-Context. arXiv:2609.17376. https://arxiv.org/abs/2609.17376
-
Liu, Y., Li, W., Dou, Y., & Ye, G. (2026). Recursive Reasoning or Statistical Extrapolation? In-Context Learning in Multi-Agent Interdependent Decision-Making. arXiv:2609.18591. https://arxiv.org/abs/2609.18591