OpenAI Astra 고발: 수학적 증명의 잠재적 표절
OpenAI Astra, 비공개 수학 연구 흡수 의혹 받음
OpenAI의 Astra 모델은 연구자들과의 비공개 대화를 통해 훈련하면서 비공개 수학적 증명을 '도둑질했다'는 의혹을 받고 있다. 이 논란은 소픽 및 하이퍼라인어 군에 대한 선도적인 전문가인 안드레아스 톰(Andreas Thom)이 중심이 되며, 그와 가브르 쿤(Gábor Kun)이 고로브(Gromov)의 소픽성 추측에 대해 연구한 내용이 Astra의 훈련 데이터에 포함되었을 가능성을 제기하고 있다. 이는 OpenAI가 Astra가 해결했다고 발표한 10대 주요 수학 문제 중 하나이다.
발표된 보고서에 따르면, 비공개 인간 연구가 모델의 훈련 데이터에 흡수되어 이후 AI에 의해 독립적인 돌파구로 제시된 것으로 보인다. 이 사건은 레벤트 알포제(Levent Alpöge)와 트리스탄 브럭마스터(Tristan Buckmaster) 연구자들이 제기한 유사한 의혹을 이어가며, 고립된 사건이 아니라 지적 재산 흡수의 패턴일 가능성을 시사한다.
잠재적 표절의 메커니즘
비평가들과 관찰자들은 이러한 의심스러운 도둑질이 발생할 수 있는 여러 메커니즘을 제안하고 있다. 주된 이론은 전면적인 모델을 사용해 아이디어를 탐색하거나 증명을 정교화하는 연구자들이 고가치의 비공개 데이터를 모델에 제공한다는 점이다. 만약 이 데이터가 이후 모델의 반복적인 훈련에 사용된다면, AI는 증명을 '재발견'하여 자신의 독자적인 발견처럼 제시할 수 있다.
병렬 구축과 데이터 수확
일부 관찰자들은 OpenAI의 데이터 생성 과정에서 의심스러운 시점에 주목하고 있다. Hacker News의 한 사용자는, 고가치 수학 증명이 훈련 데이터에 존재했을 가능성이 있는 기간 직후, 훈련 중인 모델로부터 3000억 개의 출력 토큰을 생성했다고 지적하며, 이는 발견의 출처를 가리기 위한 '병렬 구축' 과정을 시사한다고 주장했다.
'비밀 재료'의 위험성
고가의 연구에 클라우드 기반 LLM을 사용하는 것은 근본적인 취약성을 초래한다. 이러한 모델은 종종 사용자 프롬프트를 훈련에 사용해 '서비스 개선'을 목표로 하기 때문에, 연구자들은 실질적으로 AI 연구소에 자신의 '비밀 재료'를 제공하고 있는 셈이다. 이는 경쟁사와 공유되거나 모델의 돌파구로 주장될 수 있다.
커뮤니티의 시각과 반론
이 의혹은 기술 및 학계에서 AI 기반 발견의 윤리에 대한 광범위한 논의를 촉발했다.
AI 기반 진보의 주장
일부는 발견의 유용성이 귀속 문제를 초월한다고 주장한다. 이 관점에서, AI 도구가 수십 년이 걸릴 수 있는 돌파구를 가속화한다면, 누구에게 명예가 돌아가는지와는 무관하게 과학에 긍정적인 영향을 미친다. 다른 이들은 AI가 협업자 역할을 할 수 있다고 제안하며, 인간이 초기 단계(A → B → C)를 제공하고 AI가 마지막 단계(C → D)를 완성한다고 본다.
모델 능력에 대한 반론
다른 비평가들은 주된 문제는 귀속 문제뿐 아니라 모델 능력의 왜곡이라고 주장한다. '도둑질한' 증명을 독립적인 발견처럼 제시함으로써, AI 연구소는 모델의 인지 능력을 과장해 평가를 높이고 IPO를 추진하며, AGI가 달성되었다는 거짓된 서사를 조장할 수 있다.
주장에 대한 회의론
일부 회의론자들은 현재 제시된 증거가 주관적 사례에 그친다고 지적한다. 그들은 연구자들이 AI와 해당 주제에 대해 논의했다는 사실만으로는, AI가 이미 완성된 증명을 복제했다는 확실한 증거는 아니라고 본다.
학술 연구에 대한 함의
이 논란은 일부 연구자들이 AI 도구를 사용하는 방식에 변화를 가져왔다. 일부는 GitHub과 같은 플랫폼에 타임스탬프를 붙여 자신의 원본 발견을 문서화하기 시작했다. 다른 이들은 훈련 데이터의 투명성 부족으로 인해 자신의 연구가 허락 없이 사용되었는지 확인할 수 없다는 우려를 표하며, GDPR이 개인 식별 정보(PII)에 집중하는 반면, 고유한 지적 기여에 대한 보호가 부족하다는 점이 이 문제를 악화시킨다고 주장한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch