Claude 計算 N=4 超楊-米爾斯理論中的九環振幅

概述

Anthropic 已證明 Claude 能透過計算 N=4 超楊-米爾斯(SYM)理論中的九環振幅,解決理論粒子物理學的前沿問題。使用名為 Claude Science 的專業科學工具,該模型自主執行複雜的計算流程,達到了先前社群尚未解決的結果,驗證了 LLM 能在適度的計算預算下,可靠地處理高精度、多步驟的科學工作流程。

物理挑戰:N=4 超楊-米爾斯

散射振幅是粒子物理中用於計算亞原子粒子反應機率的公式。這些計算運算密集,通常以「環」來衡量,代表粒子交互作用的複雜度。大多數公式僅計算到二或三環;該領域最精確的預測通常止於五環。

為了測試新技術,物理學家使用「玩具模型」理論。N=4 超楊-米爾斯就是這樣一個模型。雖然由於其高度超對稱性(每個粒子有四個超對稱夥伴)而並非物理世界的真實描述,但矛盾的是它更容易計算,使其成為磨練振幅學技術的主要基準。

技術執行與方法

Claude 使用 Claude Science 平台達成九環計算,該平台對 Claude LLM 應用結構化規則和提示,以確保穩健的科學行為。

計算方法

Claude 使用兩種不同方法解決問題:

  1. 引導法: 類似數獨謎題的技術,模型識別答案的預期形式,並根據已知規則和預測迭代消除可能性。
  2. 間接形因數方法: 利用相關且更簡單的公式(形因數)來推導振幅的方法。

資源利用

與此類壯舉需要大量工業級計算的預期相反,此任務在學術研究人員可負擔的預算內完成。引導計算使用 Python 中的 SymPy 套件實現,使用 96 個 CPU 執行一週,花費約佔總專案預算的 100 美元(包括 LLM 執行時間成本在內,總計約一千至兩千美元)。

主要發現與影響

複雜工作流程中的可靠性

最重要的收穫之一是 Claude 能在無需持續人工監督下執行「一次性」前沿計算。此過程涉及從零開始開發脆弱程式碼,任何單一錯誤都會導致整個計算失敗。Claude 自主管理此過程,僅接收高層級指示「繼續工作」並每 4-6 小時提供更新。

與人類研究者的比較

雖然 Claude 自主解決了問題,但結果與中國科學院宋賀團隊的工作同時進行。然而,人類團隊使用 GPT-6 作為特定約束的輔助工具,而非讓 LLM 管理整體框架和執行。

「低垂果實」假說

此成就表明,若能將更好的軟體工程實踐和自主 AI 代理應用於已知方法,許多前沿科學問題可能比專家認為的更容易達成。正如物理學家 Matt von Hippel 所言:

「我最大的收穫是,低垂的果實比你想像的還要多。即使目標簡單且定義明確,有時在專家眼中看起來的可行性會比實際低得多。」

專家驗證

SLAC 和史丹佛大學的 Lance Dixon 教授驗證了此結果。他指出 Claude 的成功是執行的勝利,因為模型必須組織計算能力並精確遵循複雜的配方。Dixon 觀察到 Claude 對基礎研究論文(特別是 2019 年和 2023 年的論文)的理解,幾乎勝過除原始共同作者外的任何人。

Sources