Yuliang-Liu/MonkeyOCR
A lightweight LMM-based Document Parsing Model
解決的問題
MonkeyOCR 旨在解決文件解析的複雜性,特別是將 PDF 和圖像轉換為 Markdown 等結構化格式的挑戰。它旨在透過提供一種更精簡、高效能的方法來識別文本、公式和表格,從而取代繁瑣的多工具流水線以及使用大規模多模態模型進行全頁處理的低效方式。
工作原理
該專案採用了 Structure-Recognition-Relation (SRR) 三元組範式。這種方法透過專注於三個核心組件來簡化解析過程:識別文件結構、識別結構內的內容,以及確定不同內容區塊之間的關係。它支援中英文文件,並提供不同的模型規模(例如 1.2B 和 3B 參數)以平衡速度與準確性。
適用對象
該工具面向需要將複雜文件(PDF 或圖像)轉換為結構化、機器可讀文本的開發人員與研究人員,特別是那些處理包含數學公式與表格的多語言(英文與中文)文件的使用者。
亮點
- 高效能:在 OmniDocBench 基準測試中優於多種閉源與大型開源 VLM(如 GPT-4o 與 Gemini 2.0-Flash)。
- 靈活部署:支援廣泛的 GPU(從 4060 到 H800)並提供 Docker 部署選項。
- 全面的輸出:生成處理後的 Markdown 檔案、版面 PDF 以及包含區塊座標與關係的詳細中間 JSON 結果。
- 高效擴展:1.2B 模型在效能損失極小的情況下,比 3B 版本提供了顯著的速度提升(約 36%)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案