ispras/dedoc

Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser

解決的問題

Dedoc 是一個將各種文件格式轉換為統一輸出格式的通用系統。它解決了從 Office 文件、PDF、影像和 HTML 等半結構化與非結構化資料中,提取邏輯結構(例如標題與清單)以及內容(表格、文字格式與元資料)的問題。

工作原理

Dedoc 使用專用函式庫與機器學習技術的組合來處理不同檔案類型:

  • Office 與 Web 格式: 使用 python-docxBeautifulSoup 等函式庫分析 DOCX、XLSX 與 HTML 的內部表示。
  • PDF: 對可複製的 PDF 使用 pdfminer-six,對圖形列印使用自訂解譯器來提取格式。
  • 掃描文件: 使用 Tesseract OCR 與 OpenCV 進行影像預處理,並搭配機器學習模型偵測文件方向、欄位佈局與粗體文字。
  • 結構提取: 無論輸入格式為何,皆能自動判斷文件的階層式樹狀結構。

適用對象

專為建構自動文件分析流程、資訊分析系統,以及需要結構化資料作為分析第一步的自然語言處理(NLP)系統之開發者所設計。

主要特色

  • 通用格式支援: 支援 DOC/DOCX、ODT、XLS/XLSX、CSV、TXT、JSON、PDF、HTML 與影像(PNG、JPG)。
  • 邏輯結構提取: 將文件轉換為包含任意層級標題與清單的樹狀結構。
  • 進階 PDF 處理: 自動驗證 PDF 中文字層的正確性。
  • 表格識別: 從多種格式中提取表格資料,包括使用輪廓分析識別具有明確邊框的複雜跨頁表格。
  • 可擴充架構: 支援輕鬆新增新文件格式,並可彈性設定輸出資料格式。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案