跳到主要内容
返回时间线
Anthropic来源发表:

Schwartz 用 BootLoops 让 Claude 端到端算出 30 个费曼积分,其中 15 个此前从未被计算

核心概要

理论物理学家 Matthew Schwartz 以客座文章形式描述了他构建 BootLoops 这一面向定量科学的开源 LLM 工具架的过程:他不再要求 Claude 像人类科学家那样工作,而是寻找“Claude 形状”的问题,结果 Claude 在约 20 分钟内复现了他过去需要数周编写的代码结果,并端到端完成 30 个费曼积分(15 个为已知结果的新方法复现、15 个为此前从未被计算),随后把同一类积分方法迁移到生态学、群体遗传学等领域,在三个月内与 19 位合作者推进 36 篇手稿、覆盖 18 个领域。

AI-generated editorial illustration: Claude-shaped science

深度剖析

作者提出并实践了“Claude 形状问题”这一选题原则:不把当前 LLM 当作人类科学家来用,而是寻找与其能力匹配的问题,并用 BootLoops 这一开源工具架把这种匹配固化下来。 相对于此前把模型当作研究助理、需要逐句纠正的做法,作者改为先识别模型擅长什么(跨领域知识广度、编码能力、数学与统计的前沿知识、以机器速度解析论文与数据),再据此选题。 这是作者基于自身使用经验的自述性总结,文中以 Claude Opus 4.5 被当作研究助理时“每一句都要改”与后来按能力选题的对比作为支撑,属于经验性论证而非对照实验。

在半数值 S 矩阵 bootstrap 上,Claude 把分散在 Wolfram Language、C++、Python、Julia 以及无代码论文中的方法移植到统一框架,并推广到椭圆函数类积分,最终端到端完成 30 个积分,其中 15 个是已知结果的新方法复现、15 个是此前从未被计算的。 作者称此前只有极少数椭圆费曼积分被算出,且据其所知没有一个完全由 bootstrap 完成;障碍不是方法不可行,而是所需专长分散在许多人手中,从未有人尝试。 文中给出可核验性论证:同一套数值可让任何人(无论是否专家)通过运行两个脚本,把最终答案与积分对照到任意位数;同时给出时间对比,Claude 约 20 分钟复现作者过去数周写出的代码结果。

把同一类积分方法迁移到其他领域后,作者与领域专家合作得到若干具体结果:在生态学中解出 2005 年提出、20 年无人规模化求解的 Etienne 方程,并据此得出巴拿马 Barro Colorado Island 森林的树种组成变化比中性理论允许的快 4.5 倍;在群体遗传学中分析 1000 Genomes Project 中 57 亿对邻近突变,发现基因转换(gene conversion)机制的证据。 作者强调这些连接最初“技术上正确但科学上平淡”,是领域专家(如 James O’Dwyer、Michael Desai)把结果重新定向到本领域真正关心的问题后,才形成有意义的工作,例如减去中性预测、研究残差,或转向同一染色体上突变对之间的相关性。 生态学结果基于对既有方程与实测森林数据的计算;群体遗传学结果基于 57 亿对邻近突变的基因组分析;作者同时说明这些工作仍在进一步探索与验证之中。

作者给出了多项目并行运行的工程化组织方式:Claude Code 会话运行在 Google Cloud 虚拟机终端上,连接 GitHub 与 Overleaf 仓库,每个项目一个会话,另设主会话协调、分配算力并验证结果,并设有专门会话负责写作、建仓与工具手册、工具代码验证,以及充当对抗性审稿人反复核查。 相对于单次对话式使用,这种分层会话与后台子代理结构使作者能在三个月内同时推进 36 篇手稿、18 个领域、19 位合作者(从约 400 个候选问题中选出),并让分类器拦截只影响单个代理而不破坏整个会话。 这是作者对自身工作流的直接描述,包含具体规模数字(36 篇手稿、18 个领域、19 位合作者、三个月、约 400 个候选问题),但未提供对照或量化评估。

启示与展望

这项工作面向的是定量、可检验、且能被拆解为编码与算法开发的问题,作者明确说当前模型无法帮助他处理深层概念问题,人类仍负责概念与方向。适用场景包括:半数值 bootstrap 这类需要跨数学、物理与计算机科学专长且结果可数值核验的计算;数据丰富但理论薄弱的领域,如作者提到的系统生物学;以及拥有公开大数据集、可由 AI 挖掘隐藏生物学信号的领域,如作者所说公共档案中还有成千上万个基因组数据集。作者也把 BootLoops 定位为开源工具架,希望他人无需从零重建即可在定量科学中广泛使用,并可与任意模型搭配。

作者本人反复提示需要谨慎:在非自己领域,他发现自己倾向于认同 Claude 的判断,因此引入专家把关,并发现结果“几乎在所有情况下技术上正确,但直到专家介入前并不那么有趣”。他明确说部分亮点工作“仍在进一步探索与验证之中”。此外,文中若干处(如“例如:”“一些额外亮点包括:”“以下是更多失败模式与应对建议:”)之后没有展开内容,因此这些具体案例与失败模式清单无法从本文获知。作者还提到 Claude 缺乏时间感、给出的工期估计总是过长或过短、倾向于硬算而非造工具、长任务中压缩会丢失上下文,以及项目在算力与 token 上开销很大。读者仍需关注:这些结果在各自领域的独立复现与同行评审进展,以及作者提出的署名与研究生培养问题将如何解决。

来源