가짜 인용과 AI‑생성 논문이 동료 평가를 범람: 증거, 영향, 그리고 완화

위기의 핵심

두 명의 리뷰어가 NeurIPS, WACV, 그리고 TerraBytes 워크숍에 제출된 22개의 논문에서 가짜 인용과 저자 목록을 표시했으며, 논문의 68 %가 LLM‑생성된 부실을 명확히 보여주었고, 가짜 저자를 가진 두 논문이 여전히 구두 발표로 받아들여졌다. 환각된 참고문헌의 유병률은 이제 수만 건의 출판물에서 문서화되었으며, AI‑생성 리뷰가 일반화되고 있다.


문제의 범위

Venue Reviewer 플래그된 논문 전체 검토
NeurIPS (Datasets & Benchmarks) Caleb 2 of 5 5
NeurIPS (Position Paper) Isaac 2 of 2 2
TerraBytes (ECCV workshop) Caleb 1 of 2 2
Isaac 4 of 5 5
WACV Caleb 3 of 4 4
Isaac 3 of 4 4
Total Caleb 6 of 11 (55 %) 11
Isaac 9 of 11 (82 %) 11

이 숫자들은 더 큰 추세의 소규모 샘플이다:

  • **Nature (2026년 4월)**는 2025년 논문 수만큼 수만 건이 잘못된 AI‑생성 참고문헌을 포함할 가능성이 있다고 추정했다.
  • **Zhao et al. (arXiv 2026‑05‑07)**는 2025년 동안 arXiv, bioRxiv, SSRN, PubMed Central에서 약 146,900개의 환각 인용을 집계했으며, 그 중 85.3 %가 출판된 버전까지 지속되었다.
  • **The Lancet (2026)**은 최소 하나의 가짜 참고문헌을 포함한 논문의 비율이 2023년 2,828분의 1에서 2026년 초 277분의 1로 상승한 것을 발견했다.
  • **Ansari (arXiv 2026‑02‑05)**는 NeurIPS 2025에서 100개의 가짜 인용을 감사했으며, 모든 인용이 3‑5명의 전문가 리뷰어를 통과했으며, 53편의 논문(≈1 %의 채택)이 프로시딩에 남아 있다.

AI‑생성 리뷰도 널리 퍼져 있다

  • **Pangram (2025)**는 ICLR 2026 리뷰의 21 %가 완전 AI‑생성였으며, 절반 이상이 일부 AI 관여를 보였다고 탐지했다.
  • **Gartenberg et al. (2026)**는 Organization Science에 대한 제출이 ChatGPT 이후 42 % 증가했으며, 현재 동료 리뷰의 >30 %가 AI를 사용한다고 보고했다.
  • ICML 2026은 “no‑LLM” 정책을 위반한 795개의 리뷰(~전체의 1 %)를 식별했다.
  • **Li et al. (2026)**은 적대적으로 재작성된 초록이 AI‑리뷰어 점수를 +1.31(Gemini 3 Flash) 또는 +0.88(GPT 5.4 Mini)만큼 상승시킬 수 있음을 38 %의 공격에서 보여주었다.

리뷰어가 관찰한 내용

최악의 위반자

Isaac: 두 개의 제출물이 실제 저자를 가짜 이름으로 교체했으며, 두 논문 모두 참고문헌을 수정한다는 조건으로 구두 발표로 받아들여졌다.

Caleb: 53페이지 분량의 NeurIPS 논문이 환각된 전문 용어와 무의미한 인용으로 가득했으며, 또 다른 40페이지 논문은 각 인용 옆에 삽입된 LLM 메모를 포함하고 있었다.

가짜 인용과 가짜 저자의 상대적 심각성

두 리뷰어 모두 가짜 저자 목록이 완전히 허위인 참고문헌만큼 해롭다고 동의했으며, 이는 기본적인 주의 부족을 나타내고 전체 원고에 대한 의심을 불러일으킨다.

신뢰할 수 있는 “LLM‑작성” 징후

순위 Caleb의 징후 Isaac의 징후
1 반복적인 구문 (“It’s not X, it’s Y”), 굵은 서식, em‑대시 텍스트와 표 사이의 메트릭 불일치
2 과도하게 밀집하고 해석하기 어려운 문장 단순히 숫자를 재진술하는 장황한 토론 섹션
3 결과를 과대 포장 콜론/세미콜론의 비정상적 사용, 마케팅 스타일 언어

리뷰 워크플로우가 어떻게 변했는가

  • Bibliography first: 리뷰어는 이제 초록 바로 뒤에 참고문헌 목록을 스캔하며, 종종 bib‑audit 스킬을 사용한다.
  • Increased desk‑reject focus: 리뷰어는 논문이 전체 리뷰를 받을 가치가 있는지 판단하기 위해 가짜 참고문헌을 찾는 데 더 많은 시간을 할애한다.
  • Time allocation: 대부분의 리뷰어는 이제 노력의 상당 부분을 과학적 가치를 평가하기보다 AI 인공물 탐지에 사용하고 있다고 보고하며, 이는 지속 가능성에 대한 우려를 제기한다.

완화 도구: bib‑audit

bib‑audit는 Claude 기반 플러그인으로 다음을 수행한다:

  1. .bib, .bbl 또는 PDF 참고문헌을 구조화된 필드로 파싱한다.
  2. 각 항목을 Crossref, arXiv, DataCite, Semantic Scholar와 대조한다.
  3. 존재하지 않는 작업, 가짜 저자, 메타데이터 불일치, 형식 오류 등을 최우선으로 플래그한다.
  4. DOI 또는 arXiv ID가 없는 항목에 대해 권고 경고를 제공한다.

설치 (CLI)

claude plugin marketplace add isaaccley/skills
claude plugin install bib-audit@isaaccley-skills

제출 전 참고문헌에 스킬을 실행하고, CI 파이프라인에 읽기 전용 사전 제출 게이트로 통합할 수 있다.

정책 현황

  • NeurIPS 2025‑2026: AI‑보조 리뷰를 허용하는 것은 승인된 실험을 통해서만이며, 리뷰어는 제출물 발췌를 외부 LLM과 공유해서는 안 된다.
  • WACV 2026‑2027: AI‑생성 리뷰를 “극히 무책임”이라고 라벨링하고 규칙을 위반한 리뷰어에게 제재를 가한다.
  • ECCV 2026: 리뷰 작성이나 실질적인 제출물 공유에 LLM 사용을 금지한다.

커뮤니티 관점 (선택된 HN 댓글)

"이 시점에서 논문은 AI가 작성하고, AI가 리뷰하며, AI가 읽는다 – 우리는 인간을 학술 루프에서 자동화하고 있다." – nneonneo

"가짜 인용은 표절처럼 다루어져야 한다; 그렇지 않으면 인센티브 구조가 여전히 깨진다." – DarkUranium

"학회가 저자에게 참고문헌 PDF를 업로드하도록 요구한다면, 많은 환각을 자동으로 잡을 수 있을 것이다." – leikarnes

"우리는 desk‑reject 메커니즘이나 플래그 도구가 필요하다; 공개 정책만으로는 악의적인 행위를 막을 수 없다." – Isaac

누가 책임을 져야 하는가?

두 리뷰어는 저자가 저노력 AI‑생성 원고를 제출하기 때문에 주요 범인이라고 주장한다. 그러나 지도교수, 프로그램 체어, 학회 조직자도 더 엄격한 desk‑reject 기준을 시행하고 도구(예: bib‑audit)를 제공해 리뷰어를 부실로부터 보호해야 한다고 지적한다.


연구자와 리뷰어를 위한 시사점

  1. 검증되지 않은 참고문헌이 포함된 논문을 절대 제출하지 말 것. 업로드 전에 자동 참고문헌 감사와 수동 검사를 사용하라.
  2. LLM을 사용할 경우, 적극적으로 편집하라. 생성된 모든 인용, 메트릭, 진술을 원본 출처와 대조해 검증하라.
  3. 리뷰어는 가짜 인용을 desk‑reject 사유로 간주해야 한다. 작은 초기 단계의 참고문헌 스캔을 할당해 낭비를 방지하라.
  4. 학회는 시행 가능한 정책과 도구가 필요하다. 공개만으로는 충분하지 않으며, 자동 플래그와 명확한 처벌이 필요하다.

참고문헌 (인간 검증)

  • Naddaf & Quill, Nature 2026 – 문헌을 오염시키는 환각 인용.
  • Zhao et al., arXiv 2605.07723 – 존재하지 않는 인용에 대한 대규모 증거.
  • Topaz et al., The Lancet 2026 – 250만 건의 생물 의학 논문에 걸친 가짜 인용.
  • Ansari, arXiv 2602.05930 – NeurIPS 2025에서 100개의 가짜 인용에 대한 분류 체계.
  • Emi, Pangram blog 2025 – ICLR 2026 리뷰의 21 %가 AI‑생성.
  • Li et al., arXiv 2606.10159 – AI‑보조 동료 리뷰를 조작.
  • Gartenberg et al., Organization Science 2026 – 제출 및 리뷰에서 AI 급증.
  • Kamath, ICML blog 2026 – LLM 리뷰 정책 위반.
  • Lipton & Steinhardt, Queue 2019 – ML 논문의 “수학성”에 대한 초기 비판.

참고된 도구와 정책

Sources