Claude는 N=4 초대칭 양-밀스에서 구구-loop 진폭을 계산한다
개요
Anthropic는 Claude가 전문 과학적 허브인 Claude Science를 사용하여 N=4 초대칭 양-밀스(SYM) 이론에서 구구-loop 진폭을 계산함으로써 이론 입자 물리학의 최전선 문제를 해결할 수 있음을 입증했다. 이 모델은 복잡한 계산 절차를 자율적으로 실행하여 과학계가 이전에 해결하지 못한 결과를 도출했으며, 이는 대규모 컴퓨팅 예산 없이도 LLM이 고정밀, 다단계 과학적 워크플로우를 신뢰할 수 있게 처리할 수 있음을 입증한다.
물리적 도전: N=4 초대칭 양-밀스
산란 진폭은 입자 물리학에서 기본 입자 반응의 확률을 계산하는 데 사용되는 공식이다. 이러한 계산은 계산적으로 매우 복잡하며 일반적으로 "loop" 단위로 측정되며, 이는 입자 상호작용의 복잡성을 나타낸다. 대부분의 공식은 두 번째 또는 세 번째 loop까지 계산되며, 이 분야에서 가장 정밀한 예측은 일반적으로 다섯 번째 loop까지로 끝난다.
새로운 기술을 테스트하기 위해 물리학자들은 "장난감 모델" 이론을 사용한다. N=4 초대칭 양-밀스는 그 중 하나이다. 비록 높은 수준의 초대칭(각 입자에 대해 네 개의 초대칭 파트너가 존재)으로 인해 실제 세계를 정확히 설명하지는 않지만, 오히려 계산하기가 더 쉬워져, 진폭학 기술을 연마하는 주요 기준이 된다.
기술적 실행 및 방법론
Claude는 Claude Science 플랫폼을 사용하여 구구-loop 계산을 달성했다. 이 플랫폼은 Claude LLM에 구조화된 규칙과 프롬프트를 적용하여 과학적 행동의 강건성을 보장한다.
계산 접근법
Claude는 두 가지 다른 방법을 사용하여 문제를 해결했다:
- 부트스트랩 방법: 답의 예상 형태를 식별하고, 알려진 규칙과 예측에 기반해 가능성들을 반복적으로 제거하는 방식으로, 스도쿠 퍼즐과 유사하다.
- 간접 형식 인자 접근법: 관련된 더 간단한 공식(형식 인자)을 활용하여 진폭을 도출하는 방법이다.
자원 활용
대규모 산업용 컴퓨팅이 필요할 것이라는 예상과 달리, 이 작업은 학계 연구자들이 접근할 수 있는 예산으로 완료되었다. 부트스트랩 계산은 Python으로 구현되었으며, SymPy 패키지를 사용하여 96개의 CPU를 일주일간 사용했으며, 총 프로젝트 예산(모델 실행 비용 포함)의 약 $100에 해당했다(총 예산은 1,000~2,000달러 수준).
주요 발견 및 함의
복잡한 워크플로우에서의 신뢰성
가장 중요한 통찰 중 하나는 Claude가 지속적인 인간 감시 없이 "한 번에" 최전선 계산을 수행할 수 있다는 점이다. 이 과정은 단 하나의 오류만 있어도 전체 계산이 실패할 수 있는 취약한 코드를 처음부터 개발하는 것이었으며, Claude는 고수준 지시만 받고 4~6시간마다 업데이트를 제공하면서 자율적으로 이를 수행했다.
인간 연구자와의 비교
Claude는 문제를 자율적으로 해결했지만, 동시에 중국 과학원의 Song He 연구팀도 유사한 작업을 수행하고 있었다. 그러나 인간 팀은 전체 프레임워크와 실행을 관리하기보다는 특정 제약 조건에 대해 GPT-6를 보조 도구로 사용했다.
"낮은 과일" 가설
이 성과는 전문가들이 생각하는 것보다 많은 최전선 과학 문제들이 더 접근 가능할 수 있음을 시사한다. 단지 더 나은 소프트웨어 공학 관행과 자율적인 AI 에이전트를 기존 방법에 적용하면 된다는 것이다. 물리학자 Matt von Hippel은 다음과 같이 지적했다:
"제가 얻은 가장 큰 교훈은 예상보다 더 많은 낮은 과일이 존재한다는 것입니다. 목표가 단순하고 명확할지라도, 때로는 전문가들이 실제로 가능한 것보다 훨씬 더 불가능해 보일 수 있습니다."
전문가 검증
SLAC 및 스탠포드 대학교의 Lance Dixon 교수는 결과를 검증했다. 그는 Claude의 성공이 실행의 승리였다고 언급하며, 모델이 계산 자원을 조직하고 복잡한 계산 레시피를 정확히 따르는 능력이 핵심이라고 설명했다. Dixon은 Claude가 2019년과 2023년 논문의 본질을 거의 원저자들보다 더 잘 이해한 것처럼 보였다고 관찰했다.