arXiv에서의 AI 생성 글쓰기 측정: 트렌드와 한계
arXiv에서의 AI 생성 글쓰기 측정: 트렌드와 한계
12,750개의 arXiv 논문을 분석한 연구에 따르면, ChatGPT 출시 이후 급격한 증가를 보이며 현재 신규 제출 논문의 약 3분의 1이 기계가 작성한 것처럼 읽힌다고 합니다. 연구 결과는 학술적 글쓰기 패턴의 중대한 변화를 시사하지만, 저자들은 탐지 도구가 특정 저자를 증명하기보다는 기계와 유사한 산문 스타일을 식별한다는 점을 강조합니다.
학술 논문 내 AI 확산 트렌드
arXiv 논문에서 기계 작성 신호는 2021년과 2022년 동안 0.4%로 평이하게 유지되었으나, 이후 두 차례의 파동을 거쳐 가장 최근의 완전한 분기에는 약 32%로 상승했으며, 2026년 초에는 39% 근처에서 정점을 찍었습니다. 정확성을 보장하기 위해 연구진은 LLM 이전의 논문들을 실제 인간이 작성한 대조군(ground-truth)으로 사용하여 탐지기를 보정하였으며, 실제 ChatGPT 이전 텍스트의 0.4%만이 탐지되도록 임계값을 설정했습니다.
과학 분야별 분포
AI와 유사한 글쓰기의 채택은 학문 분야에 따라 크게 다릅니다. 2026년 7월 이전 12개월 동안 탐지된 비율은 다음과 같습니다:
| 분야 그룹 | LLM 이전 대조군 | 최근 탐지된 비율 | 95% CI |
|---|---|---|---|
| Computer science | 0.2% | 65.0% | [59.3, 70.3] |
| Quantitative biology | 3.5% | 56.3% | [51.0, 61.7] |
| Electrical eng. & systems | 1.7% | 51.3% | [46.0, 57.0] |
| Economics & finance | 2.5% | 47.0% | [41.3, 52.7] |
| Applied physics | 1.3% | 34.0% | [29.0, 39.7] |
| Statistics | 1.8% | 31.3% | [26.0, 36.7] |
| Condensed matter | 0.0% | 24.0% | [19.3, 29.0] |
| High-energy physics | 0.5% | 14.0% | [10.0, 18.0] |
| Astrophysics | 0.0% | 10.7% | [7.3, 14.3] |
| Mathematics | 0.0% | 0.7% | [0.0, 1.7] |
Computer science 분야가 65%로 가장 높은 유병률을 보이며, mathematics 분야가 0.7%로 가장 낮습니다.
방법론적 프레임워크 및 한계
연구진은 수정된 버전이 이전 시간대의 데이터에 현대적 텍스트를 유출시키는 것을 방지하기 위해 12,750개 논문의 version-1 PDF를 분석했습니다. 초록(abstract)은 종종 AI 신호를 과소평가하는 경향이이므로, 연구진은 초록 대신 본문 전체를 점수화했습니다.
주요 한계점
- Mathematics Blind Spot: mathematics 분야의 낮은 점수는 낮은 채택률보다는 탐지기의 사각지대일 가능성을 반영할 수 있습니다. 수학 논문은 표기법과 정리-증명 구조가 지배적이어서, 남은 산문 부분은 매우 적고 탐지기 학습에 사용된 과학적 영어와는 차이가 있습니다.
- Lower Bound Estimation: 저자가 사용하는 모델과 프롬프트의 모든 사적인 조합을 탐지기가 포괄하지 못할 수 있기 때문에, 보고된 유병률은 AI 지원 글쓰기의 실제 비율에 대한 하한선으로 간주됩니다.
- Detection vs. Authorship: 탐지 결과는 텍스트가 기계가 작성한 것처럼 읽힌다는 것을 의미하며, 완전히 생성된 문서와 AI의 도움을 받아 집중적으로 편집된 문서를 구분할 수 없습니다.
커뮤니티 인사이트 및 반론
연구자와 개발자들 사이의 논의는 학계에서의 AI 사용과 탐지 도구의 신뢰성에 관한 몇 가지 미묘한 차이를 강조합니다.
비원어민 영어 작성에서의 AI의 역할
많은 연구자들은 AI가 콘텐츠 생성기보다는 주로 번역 및 다듬기 도구로 사용된다고 제안합니다.
"I think most of the papers we write would be flagged by AI detectors... because we are bad at writing in a scientific style, and american editors expect us to do it. With LLMs, we can write in basic sentences and tell the LLM the idea and it converts that to nice writing."
탐지 정확도에 대한 회의론
일부 사용자들은 LLM이 존재하기 전 수년 전에 직접 작성한 논문들에 대해서도 높은 AI 점수를 보고하였으며, 이는 연구의 보정 작업에도 불구하고 위양성(false positive)의 가능성을 시사합니다.
"I uploaded a PyHPC workshop paper I wrote in 2011 and it said 27% machine. I also uploaded my PhD dissertation from 2012 and got back 40% machine."
다른 비판론자들은 학술적 글쓰기의 특성—종종 장황하고 정형화된(boilerplate) 방식—이 LLM이 생성하도록 학습된 패턴을 자연스럽게 모방하기 때문에, 언어적 분석만으로는 유기적 텍스트와 합성 텍스트를 근본적으로 구분하기 어렵다고 주장합니다.
연구 결과물 증대 가능성
일부에서는 LLM이 강력한 기술적 역량을 갖추었으나 학술적 글쓰기의 어려움을 겪는 연구자들에게 진입 장벽을 낮춰줄 수 있으며, 이는 잠재적으로 출판되는 양질의 연구의 양을 늘릴 수 있다고 주장합니다.