jerryjliu/docjev
A very fast document classifier/splitter using Jev
解決的問題
DocJev 提供了一種基於自然語言規則自動分類文件並將大型 PDF 封包拆分為個別文件的方法。它解決了手動整理多頁檔案(例如包含各種財務報告的合併 PDF)並識別文件起止點的問題,即使相鄰文件屬於同一類別也能處理。
運作方式
該系統使用 OCR 和決策引擎的管線。它使用 LiteParse(本地)或 LlamaParse(針對複雜版面的雲端 OCR)從 PDF、DOCX 或 PPTX 檔案中提取文字。這些文字隨後會發送到 Jev 決策引擎(託管服務),該引擎應用自然語言類別規則來預測文件的類別或頁面之間的邊界。此過程是頁面級別且連續的,這意味著它會識別每個區段的頁面範圍。
目標用戶
它專為需要處理大量非結構化文件封包的用戶和開發人員而設計,特別是在金融、政府或法律領域,這些領域的稅務表格、新聞稿和財務報告等文件通常會被捆綁在一起。
特色亮點
- 多格式支援: 處理 PDF、DOCX 和 PPTX 檔案。
- 靈活的規則: 使用基於 YAML 的自然語言描述來定義類別和拆分邏輯。
- 混合 OCR: 提供透過 LiteParse 進行的本地解析,以及透過 LlamaParse 進行的可選雲端 OCR。
- 審核標記: 自動標記不確定的邊界或類別衝突,以供人工審核。
- 效能基準: 包含與 GPT-5.6 Luna 等其他模型相比的決策延遲和準確度的詳細比較。
相關
- 專案
- 專案
- 專案
- 專案