UB-Mannheim/zotero-ocr

Zotero Plugin for OCR

해결하는 문제

Zotero 내에서 PDF 파일에 광학 문자 인식(OCR)을 수행할 수 있게 해주며, 검색 불가능한 PDF를 검색 가능하게 하고 문서의 이미지에서 텍스트를 추출합니다.

작동 방식

이 플러그인은 Tesseract OCR과 pdftoppm(Poppler 도구에서)를 Zotero에 통합합니다. 사용자가 PDF를 선택하고 컨텍스트 메뉴를 통해 OCR 프로세스를 트리거하면, 도구는 문서를 처리하고 인식된 텍스트를 포함하는 새 PDF, 인식된 텍스트를 포함한 노트, 또는 HTML(hOCR) 파일을 생성할 수 있습니다.

대상 사용자

스캔된 또는 이미지 기반의 PDF를 검색 가능하고 접근 가능하게 만들 필요가 있는 연구자, 학생, 학계 종사자.

주요 기능

  • Tesseract 통합: 텍스트 인식에 업계 표준인 Tesseract OCR 엔진 사용.
  • 유연한 출력: 인식된 텍스트를 포함하는 새 PDF, 텍스트 전용 노트, 또는 hOCR 파일 생성 가능.
  • 사용자 정의 설정: 출력 DPI, Tesseract 페이지 세그멘테이션 모드(PSM), 언어/스크립트 모델 조정 가능.
  • 첨부 파일 관리: 처리된 PDF를 일반 첨부 파일 또는 링크 파일로 추가 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트