Claude가 Lean에서 페르마의 마지막 정리를 형식화하다
Anthropic는 Claude가 생성한 첫 번째 완전한 컴퓨터 검증 증명인 페르마의 마지막 정리(Fermat's Last Theorem, FLT)를 발표했다. 11일 동안 주로 자율적으로 작업한 이 인공지능 시스템은 1300만 줄의 Lean 코드를 작성하고, 최종 증명에 사용된 29,500개의 중간 정리를 증명하여, 수학계가 수년이 걸릴 것으로 예상했던 형식화 작업을 완료했다.
성과: FLT의 자동 형식화
Claude의 페르마의 마지막 정리 형식화는 인간이 읽을 수 있는 수학적 추론을 컴퓨터가 알고리즘적으로 검증할 수 있는 형태로 변환하는 자동 형식화(autoformalization) 분야에서 중요한 전환점이다.
이 프로젝트의 주요 기술적 지표는 다음과 같다:
- 일정: 자율 작업 11일.
- 규모: 1300만 줄의 Lean 코드로, Mathlib(Lean의 주요 커뮤니티 라이브러리)보다 5배 이상 크다.
- 복잡성: 총 30,300개의 정리를 증명했으며, 그중 29,500개가 최종 증명에 사용되었다.
- 자원 소비: 내부 연구 모델( Claude Fable 5.1과 유사)로부터 약 60억 개의 출력 토큰을 소비했다.
이 증명은 앤드류 와일스(Andrew Wiles)가 1995년에 제시한 증명의 단순화된 버전을 따르며, 특히 Darmon, Diamond, Taylor의 설명을 기반으로 한다. 증명은 Lean의 세 가지 표준 공리만을 사용했으며, Mathlib의 FLT 진술과 일치하는지 확인기(comparator)를 통해 검증되었다.
증명 검증 도전 과제를 극복하기 위한 Prove2Me
복잡한 증명을 형식화하는 것은 어려운 일이다. 왜냐하면 Lean과 같은 증명 보조 도구는 모든 논리적 단계를 명시적으로 요구하지만, 인간의 증명은 종종 '명백한' 단계를 생략하기 때문이다. 이러한 복잡성을 관리하기 위해 Anthropic는 콜럼비아 대학교의 Tianyi Peng 및 공동 연구자들이 개발한 Prove2Me라는 오픈형 협업 플랫폼을 활용했다.
Prove2Me는 이 프로젝트의 성공을 가능하게 한 세 가지 주요 메커니즘을 제공했다:
- 방향성 없는 사이클 그래프(DAG) 관리: 정리 진술의 DAG를 유지함으로써, 여러 에이전트가 병렬로 작업할 수 있었으며, 다음에 증명해야 할 내용에 대한 명확한 로드맵을 제공함으로써 메모리 저하를 완화했다.
- 최적화된 컴파일: 정리 진술과 그 증명을 별도의 파일로 분리함으로써 Lean 컴파일 시간과 자원 소비를 줄였다.
- 자연어 인덱싱: 각 정리 진술에는 자연어 설명이 함께 제공되어, 에이전트 팀 내에서 검색과 재사용을 용이하게 했다.
수학 연구에 대한 함의
이 결과는 인공지능이 기존 수학 문헌의 대규모 부분을 형식화할 수 있음을 보여주며, 이는 분야의 엄밀성과 검증에 즉각적인 영향을 미친다.
피어 리뷰의 부담 감소
전통적으로 새로운 수학적 결과를 검증하는 데는 수개월 또는 수년이 걸릴 수 있다. 자동 형식화는 인간 심사위원의 부담을 줄이고, 현재 비용이 큰 인간 중심의 과정인 LLM 생성 수학의 엄밀한 검증을 가능하게 한다.
AI 자체의 추론 능력 향상
Anthropic는 Lean 코드를 작성하는 것이 Claude가 새로운 결과를 증명하는 데 도움이 된다고 지적한다. 발견과 병행하여 증명을 형식화함으로써, AI는 자신의 가설을 독립적으로 검증할 수 있으며, 연구자가 수치 시뮬레이션을 통해 방향성을 검증하는 것과 유사하다.
커뮤니티의 시각과 비판
이 성과는 임페리얼 칼리지 런던의 Kevin Buzzard가 "놀라운 일"이라고 평가했지만, 기술 커뮤니티 내에서 증명의 본질에 대한 논의를 촉발했다.
"스파게티 코드"에 대한 우려
일부 비판자들은 엄청난 코드량(1300만 줄)이 증명이 비효율적이거나 인간 수학자들이 추구하는 재사용 가능한 추상화가 부족하다는 신호라고 주장한다. 한 사용자는 다음과 같이 지적했다:
사실상 쓸모없다. FLT를 형식화하는 전체 목적은 현대 수론을 재사용 가능한 추상화로 정리하는 것이었다... 만약 1300만 줄의 코드라면, 너무 많은 스파게티 코드를 포함해서 결과 외에는 사용할 수 없을지도 모른다.
검증자에 대한 신뢰
AI가 Lean 커널 자체의 잠재적 버그를 악용했을 가능성에 대한 질문이 제기되었다. 증명이 너무 크고 AI가 생성했기 때문에, 일부 사용자는 "누가 검증자를 검증하는가" 문제를 제기하며, 이와 같은 대규모 출력에 대해 Metamath과 같은 더 작은 커널이 더 신뢰할 수 있을 것이라고 제안했다.
브루트 포스의 사회적 가치
"브루트 포스" 자동 형식화가 인간 중심의 형식화와 동일한 가치를 제공하는지에 대한 논쟁이 있다. 일부는 막대한 토큰 소비와 에이전트 스케일링을 통해 유명한 문제를 해결함으로써, AI 연구소들이 인간이 이해할 수 있는 형식 라이브러리를 만드는 데 필요한 철저한 노력을 저해할 수 있다고 주장한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch