baidu/Unlimited-OCR

Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.

解決的問題

Unlimited-OCR 是為「一次完成長距離解析」而設計,可讓模型在單一處理流程中處理跨多頁的複雜文件或長文件(如 PDF),超越先前的 OCR 系統(如 Deepseek-OCR)。

工作原理

本專案提供一個可處理單張影像或跨多頁文件的多模態模型。支援兩種設定模式:「gundam」(針對特定影像尺寸與裁切進行優化)與「base」(標準解析)。可透過 Hugging Face Transformers、vLLM(高吞吐量推論用)或 SGLang(支援 OpenAI 相容 API 的伺服器部署)進行整合。

適用對象

需要對長篇內容、PDF 與多頁影像進行高準確度 OCR 與文件解析的開發者與研究人員。

主要亮點

  • 長距離解析:專為處理多頁文件與長距離內容而設計。
  • 彈性部署:支援多種推論引擎,包括 Transformers、vLLM 與 SGLang。
  • PDF 支援:內建工具可將 PDF 頁面轉換為影像,實現無縫解析。
  • 高吞吐量:透過 SGLang 支援批次推論與並行請求。

相關

  • Dispatch
  • Dispatch
  • 專案
  • 專案
  • 專案