跳到主要内容
返回时间线
Anthropic来源发表:

冯·希佩尔悬赏九圈散射振幅,Anthropic 的 Claude 用约百美元算力直接算出六粒子九圈振幅,Dixon 独立验证

核心概要

物理学家兼科学作者 Matt von Hippel 公开悬赏,要求 AI 用学术级算力解决散射振幅领域的难题;Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science 平台上的 Fable 5.1,以一句提示词启动并持续催促,让 Claude 分别用 bootstrap 和 form-factor 两条路径算出平面 N=4 超杨-米尔斯理论中六粒子(六边形)九圈振幅,bootstrap 部分约花 100 美元、相当于 96 个 CPU 跑一周,SLAC 的 Lance Dixon 随后独立验证了结果,而中科院宋伟的团队也用 GPT-6 辅助算出了九圈振幅的 symbol 部分。

AI-generated editorial illustration: Yes, Claude can do Nine Loops

深度剖析

Claude 在平面 N=4 超杨-米尔斯理论中直接算出了六粒子九圈 MHV 振幅,这是该子领域此前无人完成的前沿计算。 此前该领域最高纪录是 Lance Dixon 等人在 2023 年借助 form factor 与“对跖对偶”间接得到的八圈振幅;Dixon 本人认为直接做九圈振幅“太难”,因此从未尝试。 结果由 Dixon 独立验证,他主要经由九圈 form factor 反推核对,并称已为此验证工作投入约两周;文中未给出误差棒或统计量,验证属于专家人工核对而非自动化基准。

这次计算在成本上落在学术可承受范围内:bootstrap 路径约花 100 美元,相当于 96 个 CPU 运行一周,两条路径合计对终端用户约为一两千美元。 von Hippel 的悬赏条件正是“用学术机构能拿到的算力”,而不是数百万美元的集群;结果说明算力门槛并非此前专家设想的障碍。 成本数字来自 Anthropic 两位物理学家向 von Hippel 的说明,属于自报数据,文中没有第三方账单或独立审计。

整个流程几乎无人干预:研究者只给出一句问题描述,之后仅以“继续做下去、每 4 到 6 小时汇报一次”之类的话维持运行,Claude 便从零写出全部代码并跑完两条路径。 von Hippel 对比称,同年 3 月 AI 做物理还像学生,需要大量手把手指导且错误频出;这次是顶级专家才会碰的前沿计算。 依据是作者转述的提示词原文与 Anthropic 研究者的叙述;文中明确说不知道 Claude 内部犯了多少错,只知最终未需外部合作者介入。

Dixon 指出 Claude 沿用了其团队多年发展的方法,并按他们既有的格式给出答案,因此验证 Claude 结果的同时也在反向验证他们 2019 与 2023 年的工作。 这提示 AI 在此类任务上的贡献目前是执行与工程组织,而非提出新的物理原理;Dixon 认为真正令人深思的时刻将是模型先于人类提出新物理洞见。 属于 Dixon 作为验证者的第一人称判断,文中未提供方法学上的独立对照实验。

启示与展望

这项工作面向的是振幅学中的玩具模型 N=4 超杨-米尔斯,其用途是打磨技术而非描述真实世界;作者明确说该理论“不是用来解释暗物质或任何现实事物”。因此它最直接的服务对象是从事 bootstrap 与 form factor 方法的振幅学研究者,以及想评估 AI 科学平台在长时程、脆弱计算流程中表现的团队。作者建议真实世界振幅计算领域的人也应检查 AI 科学平台能否一次性完成前沿计算,并事先准备好核查结果的方案。对更广泛的读者,这篇文章提供的是一个具体案例:在定义清晰、方法已知、算力受限的问题上,AI 可以在可承受预算内自主跑完全程。

作者自己承认没有得到他真正想要的答案:他期待看到 AI 以出人意料的新方法突破计算极限,结果 Claude 用的是已知方法,只是算得更多、工程更规范,因此他判断“我只是对极限在哪里太天真了”。他也不知道这套经验能推广多远,因为玩具模型由小圈子研究,真实世界振幅计算竞争更激烈、可能低垂果实更少。Dixon 强调该计算流程极其脆弱,“任何一处出错就会像塌掉的舒芙蕾”,而文中并未说明 Claude 内部经历了多少次失败与调试。此外,成本数字、提示词与运行时长均来自当事方叙述,宋伟团队的结果在文中也只提到算出了 symbol 部分,其完整性与发表状态未在文中交代。

来源