kotaro-kinoshita/yomitoku

YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.

解決的問題

YomiToku 是一個專為日文文字與版面設計的文件 AI 引擎。它解決了從文件影像中提取結構化資訊的問題,能處理一般 OCR 工具常難以應對的日文特有挑戰,例如垂直書寫、手寫文字以及複雜的表格結構。

工作原理

本專案使用四個自訂訓練的 AI 模型,完成完整的文件分析流程:

  1. 文字檢測:定位影像中文字所在的位置。
  2. 文字識別:將檢測到的文字區域轉換為字串,支援超過 7,000 個日文字符。
  3. 版面分析:識別文件的語意結構,包括段落、圖表與圖片。
  4. 表格結構識別:分析表格的格線與單元格結構,以維持資料之間的語意關係。

支援多種輸出格式,包括 Markdown、HTML、JSON、CSV 與可搜尋 PDF。也提供「輕量」模式,用於在 CPU 上實現更快的推論。

適用對象

  • 希望在應用中整合高精度日文 OCR 與版面分析的 開發者
  • 致力於日文文件數位化的 研究人員
  • 需要自動化提取表單、報告與發票資料的 企業(透過表格語意解析器與提取器)。

亮點

  • 日文專精:對垂直書寫與手寫日文文字具有高精度識別能力。
  • 結構化提取:能將表格轉換為結構化 JSON 或 CSV,同時保留閱讀順序。
  • 彈性提取:透過 YAML 模式,同時支援固定表單的規則提取與非結構化文件的 LLM 提取。
  • 硬體高效:可在 VRAM 少於 8GB 的 GPU 上運行,或使用輕量模型在 CPU 上運行。
  • 隱私優先的示範:提供瀏覽器端示範(YomiToku Studio),透過 WebAssembly/WebGPU 在本地執行推論,確保影像不會上傳至伺服器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案