Claude 在 N=4 超杨-米尔斯理论中计算了九圈振幅
概述
Anthropic 展示了 Claude 可以通过在 N=4 超杨-米尔斯(SYM)理论中计算九圈振幅,解决理论粒子物理领域的前沿问题。使用一种名为 Claude Science 的专用科学框架,该模型自主执行了复杂的计算流程,得出了此前整个学术界都未能解决的结果,验证了大型语言模型(LLM)能够在适度的计算预算下,可靠地处理高精度、多步骤的科学工作流。
物理挑战:N=4 超杨-米尔斯理论
散射振幅是粒子物理学中用于计算亚原子粒子反应概率的公式。这些计算非常耗时,通常以“圈数”来衡量,圈数代表粒子相互作用的复杂程度。大多数公式仅计算到两圈或三圈;该领域最精确的预测通常止步于五圈。
为了测试新方法,物理学家使用“玩具模型”理论。N=4 超杨-米尔斯就是其中之一。尽管由于其高度的超对称性(每个粒子有四个超对称伙伴),它并非对现实世界的准确描述,但恰恰因此更易于计算,使其成为磨练振幅学技术的主要基准。
技术执行与方法论
Claude 通过 Claude Science 平台实现了九圈计算,这是一个将结构化规则和提示应用于 Claude LLM 的框架,以确保稳健的科学行为。
计算方法
Claude 使用了两种不同的方法来解决该问题:
- 自举法(Bootstrap Method): 一种类似于数独的技巧,模型先确定答案的预期形式,然后基于已知规则和预测逐步排除可能性。
- 间接形式因子法(Indirect Form-Factor Approach): 一种利用相关且更简单的公式(形式因子)来推导振幅的方法。
资源利用
与人们预期需要大规模工业计算能力不同,该任务在学术研究人员可负担的预算下完成。自举计算使用 Python 实现,借助 SymPy 包,使用 96 个 CPU 运行一周,总成本约为项目预算的 100 美元(项目总预算为一到两千美元,包含 LLM 运行成本)。
关键发现与影响
复杂工作流中的可靠性
最显著的收获之一是 Claude 在无需持续人工监督的情况下完成“一次性”前沿计算的能力。该过程涉及从零开始编写脆弱的代码,其中任何单一错误都会导致整个计算失败。Claude 自主完成了这一任务,仅接收“继续工作”和每 4-6 小时提供一次更新的高层指令。
与人类研究人员的对比
尽管 Claude 自主解决了问题,但结果与中科院宋鹤团队的工作几乎同时达成。不过,人类团队仅将 GPT-6 作为特定约束的助手,而非让 LLM 管理整体框架和执行流程。
“低垂的果实”假说
这一成果表明,许多前沿科学问题可能比专家认为的更容易解决,只要将更好的软件工程实践和自主 AI 代理应用于已知方法。正如物理学家 Matt von Hippel 所指出:
"我最大的收获是,实际可实现的‘低垂果实’比你想象的要多得多。即使目标简单且定义明确,有时对专家而言看起来也远比实际更难实现。"
专家验证
SLAC 和斯坦福大学的 Lance Dixon 教授验证了该结果。他指出,Claude 的成功是执行能力的胜利,因为模型必须精确组织计算资源并严格遵循复杂的计算流程。Dixon 观察到,Claude 对底层研究论文(特别是 2019 年和 2023 年的论文)的理解,几乎超过了除原始合作者外的任何人类。