OpenAI GPT-5 초기 과학 가속 실험
OpenAI는 'GPT-5와의 초기 과학 가속 실험'이라는 제목의 연구 논문을 발표했는데, 이는 대학 및 국가 연구소와의 협력을 기록하여 모델의 과학적 발견 가속 능력을 테스트했습니다. 결과는 GPT-5가 자율적인 과학자는 아니지만, 알려진 결과를 종합하고 새로운 증명을 생성하며 검증 가능한 생물학적 메커니즘을 제안함으로써 전문가에게 강력한 힘의 배수 역할을 함을 보여줍니다.
과학 워크플로에서 GPT-5의 역할
GPT-5는 탐색의 표면적을 확장하고 가설에서 결과로 이동하는 데 필요한 시간을 단축하는 연구 파트너 역할을 합니다. 자율적으로 작동하지 않고, 의제를 정의하고 아이디어를 비판하며 결과를 검증하는 인간 과학자와 협력하여 작동합니다.
이 초기 실험에서 식별된 주요 기능은 다음과 같습니다:
- 개념적 문헌 검색: 모델은 아이디어 간의 깊은 관계를 식별하고 다양한 언어 및 접근하기 어려운 소스에서 관련 자료를 검색하여 키워드 기반 검색을 넘어갈 수 있습니다.
- 이론적 추론: 수학 및 이론 컴퓨터 과학에서 GPT-5는 몇 분 안에 실행 가능한 증명 개요를 생성하여以前 며칠 또는 몇 주가 걸리던 작업을 줄일 수 있습니다.
- 가설 생성: 생물학과 같은 경험 과학에서 모델은 관찰된 데이터에 대한 메커니즘을 제안하고 습식 실험실에서 해당 가설을 검증하기 위한 구체적인 실험을 설계할 수 있습니다.
- 분야 간 종합: 모델은 한 분야(예: 볼록 기하학)의 형식적 정리를 다른 분야의 응용(예: 밀도 추정 및 학습 이론)과 연결할 수 있습니다.
과학 가속 사례 연구
수학 및 이론 컴퓨터 과학
GPT-5는 공개된 문제를 해결하고 이론적 경계를 개선하는 데 기여했습니다:
- 에르디슈 문제: 연구자 Mehtaab Sawhney와 Mark Sellke는 GPT-5를 사용하여 에르디슈 문제 #848을 해결했습니다. 모델은 단일 '이질적인' 숫자가 집합의 나머지를 어떻게 제한하는지에 대한 핵심 통찰을 제공했으며,これが 최종 증명의 누락된 단계가 되었습니다.
- 볼록 최적화: Sébastien Bubeck는 경사 하강과 관련된 정리를 개선하기 위해 모델을 사용했습니다. GPT-5는 더 날카로운 단계 크기 경계와 더 깔끔한 증명을 제안했으며, Bubeck는 이를 손으로 검증했습니다.
- 온라인 알고리즘: Christian Coester는 볼록 몸 추적 문제의 어려운 인스턴스를 브레인스토밍하기 위해 GPT-5를 활용했으며,これにより 이전에 알려진 것보다 경쟁 비율에 대한 더 강한 하한을 이끌어냈습니다.
- 그래프 이론: 모델은 트리에서 두 부등식에 대한 짧고 우아한 증명을 생성했으며, 그중 하나는 이전에 jedynie 추측되어 왔습니다.
생물학 및 면역학
Derya Unutmaz 박사가 주도한 연구에서 GPT-5는 unpublished flow cytometry scatterplots를 분석하여 인간 면역 세포의 perplex한 변화에 대한 메커니즘을 식별했습니다. 모델은 priming 중에 방해된 N-연결 글리코실화가 원인이라고 제안하고 이를 입증하기 위해 '만노스 구조 실험'을 제안했습니다. 실험실의 기존 데이터는 모델의 예측과 정확히 일치했습니다.
물리학 및 우주론
- 블랙홀 대칭: 평면 공간에서 '예열' 문제를 제공받은 후, GPT-5 Pro는 Kerr 블랙홀 파동 방정식의 숨겨진 SL(2,ℝ) 대수 대칭을 재구성하여 인간 유도 결과와 일치시켰습니다.
- 우주론 모델: Robert Scherrer는 모델을 사용하여 도출을 sanity-check하고 다크 에너지의 다른 매개변수화 사이를 번역하여 대수적 오류를 줄였습니다.
- 융합 및 플라즈마 물리학: 모델은 열핵 연소 전파를 위한 축소 물리학 모델 구축을 도와주고 연소 전면에 대한 최적 밀도 프로파일을 식별했습니다.
기술적 제한 및 요구 사항
이러한 성공에도 불구하고, OpenAI는 몇 가지 지속적인 실패 모드 때문에 전문가의 감독이 필수적이라고 강조합니다:
- 환각: GPT-5는 그럴듯해 보이지만 거짓인 인용, 메커니즘, 또는 증명을 생성할 수 있습니다.
- 출처 누락: 클리크-회피 코드를 포함한 한 사례에서 모델은 출처를 인용하지 않고 이전 연구 논문의 올바른 논리를 재생산했으며, 새로운 세션에서 명시적으로 요청했을 때만 원래 작업을 식별했습니다.
- 민감도: 모델의 성능은 'scaffolding'(문제가 어떻게 프레임되는지)과 reasoning을 priming하기 위한 'warm-up' 문제 사용에 민감할 수 있습니다.
- 추론 오류: 인간 전문가가 수정하지 않으면 비생산적인 추론 경로를 따를 수 있습니다.
미래 방향
OpenAI는 GPT-5의 현재 기능이 증가된 컴퓨팅과 추론 시간에 따라 개선될 기반이라고 가정합니다. 실험실은 모델이 20분 안에 연구 질문에 도움을 줄 수 있다면, 모델이 복잡한 문제에 대해 몇 시간 또는 며칠 동안 추론할 수 있도록 허용될 때 더 깊은 결과가 나타날 것으로 기대합니다.