baidu/Unlimited-OCR
Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.
解決的問題
Unlimited-OCR 是為「一次完成長距離解析」而設計,可讓模型在單一處理流程中處理跨多頁的複雜文件或長文件(如 PDF),超越先前的 OCR 系統(如 Deepseek-OCR)。
工作原理
本專案提供一個可處理單張影像或跨多頁文件的多模態模型。支援兩種設定模式:「gundam」(針對特定影像尺寸與裁切進行優化)與「base」(標準解析)。可透過 Hugging Face Transformers、vLLM(高吞吐量推論用)或 SGLang(支援 OpenAI 相容 API 的伺服器部署)進行整合。
適用對象
需要對長篇內容、PDF 與多頁影像進行高準確度 OCR 與文件解析的開發者與研究人員。
主要亮點
- 長距離解析:專為處理多頁文件與長距離內容而設計。
- 彈性部署:支援多種推論引擎,包括 Transformers、vLLM 與 SGLang。
- PDF 支援:內建工具可將 PDF 頁面轉換為影像,實現無縫解析。
- 高吞吐量:透過 SGLang 支援批次推論與並行請求。
相關
- Dispatch
- Dispatch
- 專案
- 專案
- 專案