引言

2026年8月,一位名叫马特·冯·希佩尔(Matt von Hippel)的物理学家在自己的博客上发了一篇"战书"。

他曾是一名理论物理学家,现在转行做科学写作。他在粒子物理的散射振幅领域摸爬滚打多年,深知这个领域有一块"硬骨头"——一类计算量极其庞大的公式,人类学者花了十几年也只推进到第8圈,没有人能突破到第9圈。不是不知道该怎么做,而是计算量太大,普通课题组根本跑不动。

他的挑战很简单:如果AI公司想证明自己真能搞科研,那就来做我们做不了的事。用普通学者用得起的电脑和预算,把散射振幅推进到第9圈。

他大概预期,这个挑战至少要难住AI好几年。

结果,一个月后,就有人来交卷了。

先说人话:什么是"散射振幅"和"圈"?

让我们把那些专业术语全部扔掉,用一个比喻来理解。

想象你站在一个巨大的弹珠台前。有人从顶部扔进去一颗弹珠,它在密密麻麻的钉子之间弹来弹去,最后从底部的某个出口掉出来。你想知道的是:这颗弹珠从某个特定出口掉出来的概率是多少?

在粒子物理学里,物理学家做的事情本质上是一样的——只不过"弹珠"是微观粒子,“钉子"是各种力的相互作用,“出口"是探测器能观测到的结果。那个描述"弹珠从哪个出口出来"的数学公式,就叫散射振幅。

但问题来了:粒子之间的相互作用太复杂了。一颗弹珠可能只碰一颗钉子就出去了(这叫"0圈”),也可能碰了两颗钉子(“1圈”),三颗(“2圈”)……每多碰一颗钉子,计算量就爆炸式增长。

实际操作中,大多数散射振幅公式只算到了2圈或3圈。人类粒子物理学的精度巅峰——电子反常磁矩的计算——也不过是5圈。

而希佩尔挑战的,是第9圈。

一个"玩具宇宙"里的极限挑战

这里有一个微妙之处:物理学家并不是在算真实世界的粒子。他们在算一个叫做"N=4超对称杨-米尔斯理论"的模型。

这个名字听起来很吓人,但本质上它是一个"玩具宇宙”——一个被简化过的、不完全是真实世界的理论模型。它的粒子数量比真实世界多(每种粒子有4个"超对称伙伴"),但因为对称性极高,反而更容易算出精确结果。

这就好比:你没法在真正的暴风雨中精确模拟每一滴水珠的运动,但你可以先在一个完美正方体的水箱里研究水波——条件理想化了,但数学上更干净,可以用来检验新方法。

从2011年到2023年,斯坦福大学加速器实验室的兰斯·狄克逊(Lance Dixon)教授和他的团队,用了整整12年时间,将这个玩具宇宙里的散射振幅从3圈推进到了8圈。

从8圈到9圈,在所有人看来,都意味着又一轮漫长的苦战。

自举法:像解数独一样做物理

狄克逊团队使用的方法叫做"自举法"(bootstrap),这个方法名来源于一个英语俗语"pull yourself up by your bootstraps"——拽着自己的鞋带把自己提起来。

翻译成物理语言就是:你不需要从头算出答案,你只需要猜出答案"大概长什么样",然后用已知的物理规则一层一层排除错误选项,直到只剩下唯一正确的答案。

这就像解一道极其复杂的数独。你不需要每一步都从头推理,你只需要在格子里填满所有可能的数字,然后根据各行各列的规则,一个个划掉不可能的选项。到最后,格子里只剩一个数字——那就是答案。

问题是,圈数越多,“格子"就越大,“规则"就越多,整个排除过程就越漫长、越容易出错。到了8圈,这已经是人类团队花了好几年才啃下来的硬骨头。

那一夜:物理学家去睡觉了,让AI继续干

2026年8月底,Anthropic公司的两位物理学家——利亚姆·菲茨帕特里克和悉达思·米什拉-夏尔马——在博客上读到了希佩尔的挑战。

他们决定试试。

他们没有动用价值数百万美元的超算中心。他们打开了一套叫做"Claude Science"的科研平台——这是一个让科学家付费使用Claude的商业工具。他们用的模型是Fable 5.1。

接下来的操作,简单得让人难以置信:

他们先问Claude:“你最有可能解决哪个问题?”

Claude回答:平面N=4超杨-米尔斯理论的9圈六粒子振幅。

然后他们输入了一行任务描述——就这么一句话,启动了整个计算。

然后,他们留下了一句非常有生活气息的指令:

“我要去睡觉了,接下来几个小时都不会在线。请继续运算,直到我叫停。每隔4到6小时给我汇报一下进度。”

然后,物理学家就去睡觉了。

而Claude开始了一场持续一周的"马拉松”——它在96个普通CPU核心上运行,用Python语言和SymPy符号计算库,从零开始编写了完整的自举检验流程。

请注意:它不是在执行人类写好的程序。它是自己阅读了狄克逊团队2019年和2023年发表的论文,理解了整个自举方法的逻辑,然后自己写出了所有代码。论文里有很多"boring details”——那些太琐碎以至于作者懒得写清楚的工程细节——Claude全部自己补上了。

更厉害的是,在运算的后半段,Claude自己做了一个"双保险"决定:除了直接算振幅之外,它还通过一条间接路径(计算与振幅相关但更简单的"形状因子")做了第二遍。两条完全独立的路线,最终给出了完全一致的答案——超过10万个非零系数,全部吻合。

账单:不到2000美元

整个项目的成本是多少?

96个CPU跑一周的电费和服务器费用:大约100美元。

加上调用Claude的API费用:总计1000到2000美元。

这相当于一个普通大学课题组一个月的日常经费。

12年的人类学术积累,被一台花了几千块钱的系统,在一周内,在物理学家睡觉的时候,独立完成了。

验证:斯坦福教授花了两周

9月1日,Anthropic团队把结果发给了狄克逊教授。

狄克逊花了整整两周时间,用他团队多年来积累的检验工具,对Claude提交的代码和最终答案进行了严密复核。

结果:完全正确。

狄克逊教授后来写了一段话,作为这篇博客的"附录"——标题是:“被一台机器抢了先,是什么感觉?”

他写道:

“大多数理论物理学家早就承认,大语言模型迟早会彻底改变物理学。问题只是:这一天什么时候真正到来?对我来说,是9月1日。”

“让我真正震撼的不是Claude完成了一个大计算任务,而是整个计算过程的脆弱性。这种计算中,任何一步代码的缩进错误、任何一个代数符号的微小差错,都会让一切都像失败的舒芙蕾一样坍塌。而Claude从头到尾,没有犯一个错。”

“更有趣的是:Claude用的方法,恰恰是我和合作者多年来开发的方法。它呈现结果的方式,也和我们一贯的格式一模一样。所以,表面上看是Claude验证了9圈答案,但实际上,是Claude验证了我们之前所有的工作。我认为,Claude对我们2019年和2023年论文的理解,超越了除我合作者之外的任何人。”

“这会让我感到痛苦吗?不。真正让我灵魂拷问的时刻,会是大语言模型开始独立提出新的物理原理和洞见的那一天。”

这件事为什么重要?

第一,AI科研的"性价比门槛"已经被踏破了。

此前很多人认为,AI也许能在数学上有所突破(因为数学靠的是"好想法"),但在计算密集型的基础物理领域,AI可能无能为力——因为那需要太多的算力。

但Claude证明的是:不是算力不够,是人类没想过用AI来组织这些算力。同一个问题、同样的方法,AI用普通课题组买得起的电脑就解出来了。

第二,AI科研的"可靠性"超出了很多人的预期。

这种计算极其脆弱——就像叠纸牌屋,一个微小的错误就会全盘崩溃。人类做这种计算,几乎不可能一次成功,总要反复调试好几轮。而Claude在"几乎没有人盯着"的情况下,一次就做到了终点。

第三,“低垂的果实"可能比我们想象的更多。

希佩尔在文章最后的反思特别有意思。他原本希望通过这次挑战,看到AI发明出什么全新方法、做出什么让人意想不到的突破。结果,Claude用的恰恰是人类已有的方法,只是做得更好、更快、更可靠。

“我本来想看看AI能 pushed 到多远的计算极限,结果发现,我只是对自己领域里的极限在哪这件事上,太天真了。”

换句话说:不是AI强到了不可思议的地步,是人类一直在低估自己手边能做到的事。

AI还做了什么?几乎同时,中国团队也做到了

就在Anthropic宣布结果几天后,中国科学院的宋鹤团队也宣布他们独立完成了9圈振幅的大部分计算。他们使用了GPT-6作为辅助工具来帮助计算某些约束条件,但整体框架仍然是人类主导的。

两周内,一个9圈难题,被AI独立解了一次,又被"人+AI"组合解了一次。

这不是巧合,这是一个信号:这个领域的计算极限,确实在AI的射程之内。

尾声:AI是伙伴,但还不是提出新问题的人

科技日报在报道此事时写了一段精准的总结:

“AI没有发现新物理。它是在人类已经提出的物理框架下,独立完成了前沿解析理论计算。AI是强大的伙伴,但还不是新问题的提出者和新模型的创造者。”

狄克逊教授说得很坦诚:真正让他"灵魂震动"的时刻还没到来——那一天,是AI开始独立提出物理原理的时刻。

但这一天,也许比我们所有人想象的都要近。

2026年3月,AI还像一个需要手把手带的物理系学生,做小规模任务,经常犯错。到2026年9月,它已经能独立攻克前沿计算难题。仅仅半年。

希佩尔发起挑战时,他想知道AI能不能做到他当年做不到的事。现在他知道了——不是能不能的问题,是什么时候的问题。而答案可能比所有人预期的都要快。


参考来源:

  1. Matt von Hippel, “Yes, Claude can do Nine Loops”, Anthropic Research Blog, 2026年9月25日. https://www.anthropic.com/research/yes-claude-can-do-nine-loops
  2. 科技日报, “仅用数天时间 大模型Claude完成散射振幅九圈计算”, 2026年9月29日.
  3. Lance Dixon et al., “Eight-loop four-point amplitude in planar N=4 super-Yang-Mills”, arXiv:2308.08199, 2023.
  4. Matt von Hippel, “It Only Counts When AI Gets to My Field”, 4gravitons.com, 2026年8月7日.
  5. 量子位/36氪, “AI找出数学反例推翻论文,作者确认,453篇手稿”, 2026年9月29日.