ispras/dedoc
Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser
解決的問題
Dedoc 是一個將各種文件格式轉換為統一輸出格式的通用系統。它解決了從 Office 文件、PDF、影像和 HTML 等半結構化與非結構化資料中,提取邏輯結構(例如標題與清單)以及內容(表格、文字格式與元資料)的問題。
工作原理
Dedoc 使用專用函式庫與機器學習技術的組合來處理不同檔案類型:
- Office 與 Web 格式: 使用
python-docx與BeautifulSoup等函式庫分析 DOCX、XLSX 與 HTML 的內部表示。 - PDF: 對可複製的 PDF 使用
pdfminer-six,對圖形列印使用自訂解譯器來提取格式。 - 掃描文件: 使用 Tesseract OCR 與 OpenCV 進行影像預處理,並搭配機器學習模型偵測文件方向、欄位佈局與粗體文字。
- 結構提取: 無論輸入格式為何,皆能自動判斷文件的階層式樹狀結構。
適用對象
專為建構自動文件分析流程、資訊分析系統,以及需要結構化資料作為分析第一步的自然語言處理(NLP)系統之開發者所設計。
主要特色
- 通用格式支援: 支援 DOC/DOCX、ODT、XLS/XLSX、CSV、TXT、JSON、PDF、HTML 與影像(PNG、JPG)。
- 邏輯結構提取: 將文件轉換為包含任意層級標題與清單的樹狀結構。
- 進階 PDF 處理: 自動驗證 PDF 中文字層的正確性。
- 表格識別: 從多種格式中提取表格資料,包括使用輪廓分析識別具有明確邊框的複雜跨頁表格。
- 可擴充架構: 支援輕鬆新增新文件格式,並可彈性設定輸出資料格式。
相關
- 專案
- 專案
- 專案
- 專案
- 專案