가짜 인용과 AI‑생성 논문이 동료 평가를 범람: 증거, 영향, 그리고 완화
위기의 핵심
두 명의 리뷰어가 NeurIPS, WACV, 그리고 TerraBytes 워크숍에 제출된 22개의 논문에서 가짜 인용과 저자 목록을 표시했으며, 논문의 68 %가 LLM‑생성된 부실을 명확히 보여주었고, 가짜 저자를 가진 두 논문이 여전히 구두 발표로 받아들여졌다. 환각된 참고문헌의 유병률은 이제 수만 건의 출판물에서 문서화되었으며, AI‑생성 리뷰가 일반화되고 있다.
문제의 범위
| Venue | Reviewer | 플래그된 논문 | 전체 검토 |
|---|---|---|---|
| NeurIPS (Datasets & Benchmarks) | Caleb | 2 of 5 | 5 |
| NeurIPS (Position Paper) | Isaac | 2 of 2 | 2 |
| TerraBytes (ECCV workshop) | Caleb | 1 of 2 | 2 |
| Isaac | 4 of 5 | 5 | |
| WACV | Caleb | 3 of 4 | 4 |
| Isaac | 3 of 4 | 4 | |
| Total | Caleb | 6 of 11 (55 %) | 11 |
| Isaac | 9 of 11 (82 %) | 11 |
이 숫자들은 더 큰 추세의 소규모 샘플이다:
- **Nature (2026년 4월)**는 2025년 논문 수만큼 수만 건이 잘못된 AI‑생성 참고문헌을 포함할 가능성이 있다고 추정했다.
- **Zhao et al. (arXiv 2026‑05‑07)**는 2025년 동안 arXiv, bioRxiv, SSRN, PubMed Central에서 약 146,900개의 환각 인용을 집계했으며, 그 중 85.3 %가 출판된 버전까지 지속되었다.
- **The Lancet (2026)**은 최소 하나의 가짜 참고문헌을 포함한 논문의 비율이 2023년 2,828분의 1에서 2026년 초 277분의 1로 상승한 것을 발견했다.
- **Ansari (arXiv 2026‑02‑05)**는 NeurIPS 2025에서 100개의 가짜 인용을 감사했으며, 모든 인용이 3‑5명의 전문가 리뷰어를 통과했으며, 53편의 논문(≈1 %의 채택)이 프로시딩에 남아 있다.
AI‑생성 리뷰도 널리 퍼져 있다
- **Pangram (2025)**는 ICLR 2026 리뷰의 21 %가 완전 AI‑생성였으며, 절반 이상이 일부 AI 관여를 보였다고 탐지했다.
- **Gartenberg et al. (2026)**는 Organization Science에 대한 제출이 ChatGPT 이후 42 % 증가했으며, 현재 동료 리뷰의 >30 %가 AI를 사용한다고 보고했다.
- ICML 2026은 “no‑LLM” 정책을 위반한 795개의 리뷰(~전체의 1 %)를 식별했다.
- **Li et al. (2026)**은 적대적으로 재작성된 초록이 AI‑리뷰어 점수를 +1.31(Gemini 3 Flash) 또는 +0.88(GPT 5.4 Mini)만큼 상승시킬 수 있음을 38 %의 공격에서 보여주었다.
리뷰어가 관찰한 내용
최악의 위반자
Isaac: 두 개의 제출물이 실제 저자를 가짜 이름으로 교체했으며, 두 논문 모두 참고문헌을 수정한다는 조건으로 구두 발표로 받아들여졌다.
Caleb: 53페이지 분량의 NeurIPS 논문이 환각된 전문 용어와 무의미한 인용으로 가득했으며, 또 다른 40페이지 논문은 각 인용 옆에 삽입된 LLM 메모를 포함하고 있었다.
가짜 인용과 가짜 저자의 상대적 심각성
두 리뷰어 모두 가짜 저자 목록이 완전히 허위인 참고문헌만큼 해롭다고 동의했으며, 이는 기본적인 주의 부족을 나타내고 전체 원고에 대한 의심을 불러일으킨다.
신뢰할 수 있는 “LLM‑작성” 징후
| 순위 | Caleb의 징후 | Isaac의 징후 |
|---|---|---|
| 1 | 반복적인 구문 (“It’s not X, it’s Y”), 굵은 서식, em‑대시 | 텍스트와 표 사이의 메트릭 불일치 |
| 2 | 과도하게 밀집하고 해석하기 어려운 문장 | 단순히 숫자를 재진술하는 장황한 토론 섹션 |
| 3 | 결과를 과대 포장 | 콜론/세미콜론의 비정상적 사용, 마케팅 스타일 언어 |
리뷰 워크플로우가 어떻게 변했는가
- Bibliography first: 리뷰어는 이제 초록 바로 뒤에 참고문헌 목록을 스캔하며, 종종
bib‑audit스킬을 사용한다. - Increased desk‑reject focus: 리뷰어는 논문이 전체 리뷰를 받을 가치가 있는지 판단하기 위해 가짜 참고문헌을 찾는 데 더 많은 시간을 할애한다.
- Time allocation: 대부분의 리뷰어는 이제 노력의 상당 부분을 과학적 가치를 평가하기보다 AI 인공물 탐지에 사용하고 있다고 보고하며, 이는 지속 가능성에 대한 우려를 제기한다.
완화 도구: bib‑audit
bib‑audit는 Claude 기반 플러그인으로 다음을 수행한다:
.bib,.bbl또는 PDF 참고문헌을 구조화된 필드로 파싱한다.- 각 항목을 Crossref, arXiv, DataCite, Semantic Scholar와 대조한다.
- 존재하지 않는 작업, 가짜 저자, 메타데이터 불일치, 형식 오류 등을 최우선으로 플래그한다.
- DOI 또는 arXiv ID가 없는 항목에 대해 권고 경고를 제공한다.
설치 (CLI)
claude plugin marketplace add isaaccley/skills
claude plugin install bib-audit@isaaccley-skills
제출 전 참고문헌에 스킬을 실행하고, CI 파이프라인에 읽기 전용 사전 제출 게이트로 통합할 수 있다.
정책 현황
- NeurIPS 2025‑2026: AI‑보조 리뷰를 허용하는 것은 승인된 실험을 통해서만이며, 리뷰어는 제출물 발췌를 외부 LLM과 공유해서는 안 된다.
- WACV 2026‑2027: AI‑생성 리뷰를 “극히 무책임”이라고 라벨링하고 규칙을 위반한 리뷰어에게 제재를 가한다.
- ECCV 2026: 리뷰 작성이나 실질적인 제출물 공유에 LLM 사용을 금지한다.
커뮤니티 관점 (선택된 HN 댓글)
"이 시점에서 논문은 AI가 작성하고, AI가 리뷰하며, AI가 읽는다 – 우리는 인간을 학술 루프에서 자동화하고 있다." – nneonneo
"가짜 인용은 표절처럼 다루어져야 한다; 그렇지 않으면 인센티브 구조가 여전히 깨진다." – DarkUranium
"학회가 저자에게 참고문헌 PDF를 업로드하도록 요구한다면, 많은 환각을 자동으로 잡을 수 있을 것이다." – leikarnes
"우리는 desk‑reject 메커니즘이나 플래그 도구가 필요하다; 공개 정책만으로는 악의적인 행위를 막을 수 없다." – Isaac
누가 책임을 져야 하는가?
두 리뷰어는 저자가 저노력 AI‑생성 원고를 제출하기 때문에 주요 범인이라고 주장한다. 그러나 지도교수, 프로그램 체어, 학회 조직자도 더 엄격한 desk‑reject 기준을 시행하고 도구(예: bib‑audit)를 제공해 리뷰어를 부실로부터 보호해야 한다고 지적한다.
연구자와 리뷰어를 위한 시사점
- 검증되지 않은 참고문헌이 포함된 논문을 절대 제출하지 말 것. 업로드 전에 자동 참고문헌 감사와 수동 검사를 사용하라.
- LLM을 사용할 경우, 적극적으로 편집하라. 생성된 모든 인용, 메트릭, 진술을 원본 출처와 대조해 검증하라.
- 리뷰어는 가짜 인용을 desk‑reject 사유로 간주해야 한다. 작은 초기 단계의 참고문헌 스캔을 할당해 낭비를 방지하라.
- 학회는 시행 가능한 정책과 도구가 필요하다. 공개만으로는 충분하지 않으며, 자동 플래그와 명확한 처벌이 필요하다.
참고문헌 (인간 검증)
- Naddaf & Quill, Nature 2026 – 문헌을 오염시키는 환각 인용.
- Zhao et al., arXiv 2605.07723 – 존재하지 않는 인용에 대한 대규모 증거.
- Topaz et al., The Lancet 2026 – 250만 건의 생물 의학 논문에 걸친 가짜 인용.
- Ansari, arXiv 2602.05930 – NeurIPS 2025에서 100개의 가짜 인용에 대한 분류 체계.
- Emi, Pangram blog 2025 – ICLR 2026 리뷰의 21 %가 AI‑생성.
- Li et al., arXiv 2606.10159 – AI‑보조 동료 리뷰를 조작.
- Gartenberg et al., Organization Science 2026 – 제출 및 리뷰에서 AI 급증.
- Kamath, ICML blog 2026 – LLM 리뷰 정책 위반.
- Lipton & Steinhardt, Queue 2019 – ML 논문의 “수학성”에 대한 초기 비판.
참고된 도구와 정책
bib-auditplugin: https://github.com/isaaccley/skills/tree/main/plugins/bib-audit- John Owens’s bibliography error guide: https://www.ece.ucdavis.edu/~jowens/biberrors.html
- NeurIPS LLM 정책 (2025) 및 AI‑리뷰 실험 (2026)
- WACV 리뷰어 가이드라인 (2026, 2027)
- ECCV 2026 리뷰 정책