kotaro-kinoshita/yomitoku

YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.

해결하는 문제

YomiToku는 일본어 텍스트와 레이아웃에 특화된 문서 AI 엔진입니다. 일반적인 OCR 도구가 어려워하는 세로쓰기, 손글씨, 복잡한 표 구조와 같은 일본어 고유의 도전 과제를 해결하며, 문서 이미지에서 구조화된 정보를 추출하는 문제를 해결합니다.

작동 방식

이 프로젝트는 문서 분석의 전체 파이프라인을 수행하기 위해 네 가지 맞춤형 훈련된 AI 모델을 사용합니다:

  1. 텍스트 탐지: 이미지 내 텍스트가 위치한 곳을 찾습니다.
  2. 텍스트 인식: 탐지된 텍스트 영역을 문자열로 변환하며, 7,000개 이상의 일본어 문자를 지원합니다.
  3. 레이아웃 분석: 단락, 그림, 이미지와 같은 문서의 의미적 구조를 식별합니다.
  4. 표 구조 인식: 표의 격자 및 셀 구조를 분석하여 데이터 간 의미적 관계를 유지합니다.

Markdown, HTML, JSON, CSV, 검색 가능한 PDF 등 다양한 출력 형식을 제공합니다. 또한 CPU 기반의 빠른 추론을 위한 "라이트" 모드도 포함되어 있습니다.

대상 사용자

  • 일본어 OCR 및 레이아웃 분석을 애플리케이션에 통합하고자 하는 개발자.
  • 일본어 문서 디지털화에 종사하는 연구자.
  • 양식, 보고서, 청구서에서 데이터 추출을 자동화하고자 하는 기업 (Table Semantic Parser and Extractor를 통해).

주요 특징

  • 일본어 전문성: 세로쓰기 및 손글씨 일본어 텍스트에 대해 높은 정확도를 제공합니다.
  • 구조화된 추출: 표를 구조화된 JSON 또는 CSV로 변환하면서 읽기 순서를 유지합니다.
  • 유연한 추출: 고정 양식용 룰 기반 추출과 비구조화 문서용 LLM 기반 추출을 YAML 스키마를 통해 제공합니다.
  • 하드웨어 효율성: 8GB VRAM 미만의 GPU 또는 가벼운 모델을 사용한 CPU에서도 작동 가능합니다.
  • 개인정보 우선의 데모: WebAssembly/WebGPU를 통해 브라우저 기반 데모(YomiToku Studio)에서 로컬에서 추론이 수행되어 이미지가 서버에 업로드되지 않습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트