gianlucasb/hallucinator
A tool to detect potentially hallucinated or fabricated references in academic PDF papers.
해결하는 문제
이 도구는 대규모 언어 모델(LLM)이 생성한 가짜 참조(현실에 존재하지 않지만 정당해 보이는 참조) 문제를 해결하며, AI로 생성된 '스럽(slop)'이 학술 출판에 확산되는 문제를 다룹니다. 논문 내 참조가 진짜인지 위조되었는지 체계적으로 검증할 수 있는 방법을 제공합니다.
작동 방식
- 추출: MuPDF를 사용해 PDF에서 텍스트를 추출하고, 참고문헌 또는 문헌 목록 섹션을 식별합니다.
- 구문 분석: 각 참조에서 제목과 저자를 추출합니다.
- 병렬 검증: CrossRef, arXiv, DBLP, OpenAlex, PubMed 등의 여러 학술 데이터베이스를 병렬로 쿼리하여 참조가 존재하는지 확인합니다.
- 검증: 참조를 "검증됨"(제목과 저자 일치), "저자 불일치"(제목은 발견되었으나 저자 다름), 또는 "미발견"(가짜 가능성)으로 표시합니다.
- 백업 기능: 데이터베이스에서 찾을 수 없는 참조에 대해, SearxNG 웹 검색을 선택적으로 사용해 제목이 웹상에 존재하는지 확인할 수 있습니다.
대상 사용자
제출된 논문의 참조의 진위를 검증해야 하는 학술 리뷰어, 연구자, 편집자.
주요 기능
- 광범위한 데이터베이스 커버리지: CrossRef, arXiv, DBLP, Semantic Scholar, ACL Anthology, Europe PMC, PubMed, OpenAlex, Open Library 등 다양한 출처를 대상으로 검증.
- 하이브리드 온라인/오프라인 모드: DBLP, arXiv, ACL Anthology, OpenAlex용 로컬 SQLite/Tantivy 인덱스를 다운로드 가능. API 레이트 제한 및 봇 보호를 회피.
- 재게재 감지: CrossRef 메타데이터를 사용해 검증된 논문이 재게재되었는지 자동으로 표시.
- 다중 인터페이스 지원: Rust 기반 TUI, CLI, Python 바인딩 제공. 다른 워크플로우에 통합 가능.
- 성능: 실패한 요청에 대한 조기 종료 및 재시도 로직을 포함한 병렬 쿼리 구현.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트