jerryjliu/docjev

A very fast document classifier/splitter using Jev

解決的問題

DocJev 提供了一種基於自然語言規則自動分類文件並將大型 PDF 封包拆分為個別文件的方法。它解決了手動整理多頁檔案(例如包含各種財務報告的合併 PDF)並識別文件起止點的問題,即使相鄰文件屬於同一類別也能處理。

運作方式

該系統使用 OCR 和決策引擎的管線。它使用 LiteParse(本地)或 LlamaParse(針對複雜版面的雲端 OCR)從 PDF、DOCX 或 PPTX 檔案中提取文字。這些文字隨後會發送到 Jev 決策引擎(託管服務),該引擎應用自然語言類別規則來預測文件的類別或頁面之間的邊界。此過程是頁面級別且連續的,這意味著它會識別每個區段的頁面範圍。

目標用戶

它專為需要處理大量非結構化文件封包的用戶和開發人員而設計,特別是在金融、政府或法律領域,這些領域的稅務表格、新聞稿和財務報告等文件通常會被捆綁在一起。

特色亮點

  • 多格式支援: 處理 PDF、DOCX 和 PPTX 檔案。
  • 靈活的規則: 使用基於 YAML 的自然語言描述來定義類別和拆分邏輯。
  • 混合 OCR: 提供透過 LiteParse 進行的本地解析,以及透過 LlamaParse 進行的可選雲端 OCR。
  • 審核標記: 自動標記不確定的邊界或類別衝突,以供人工審核。
  • 效能基準: 包含與 GPT-5.6 Luna 等其他模型相比的決策延遲和準確度的詳細比較。

相關

  • 專案
  • 專案
  • 專案
  • 專案