privatenumber/mac-ocr

macOS CLI for OCR and searchable PDFs using Apple's Vision framework

解決的問題

mac-ocr 是一個 macOS 上的命令列工具與 Node.js API,支援在本地、私密環境下進行 OCR(光學字元辨識)。使用者無需將資料上傳至外部伺服器,即可從影像與 PDF 中提取文字,為 AI 代理與使用者提供免費且注重隱私的雲端視覺權杖替代方案。

工作原理

此工具為原生 Swift 二進位檔,利用 Apple 的 Vision 框架(VNRecognizeTextRequestRecognizeDocumentsRequest)在裝置上本地處理影像與 PDF。對於可搜尋的 PDF,它使用 Core Graphics 與 Core Text 在原始影像上繪製一個不可見的文字層,將文字精確放置於 Vision 框架偵測到的位置。

適用對象

  • 開發者:希望透過在本地執行 OCR,而非使用多模態大模型,來降低 AI 代理的開發成本。
  • macOS 使用者:需要將掃描文件或影像轉換為可搜尋、可選擇的 PDF 或純文字/JSON 檔案的使用者。
  • Node.js 開發者:希望透過類型化 API 將本地 OCR 功能整合至應用程式的開發者。

主要特色

  • 隱私優先:完全在裝置上執行,無資料上傳。
  • 可搜尋 PDF:將影像或掃描 PDF 轉換為帶有可選擇文字層的 PDF。
  • 結構化資料:支援提取段落、表格與清單(macOS 26+)。
  • 彈性輸出:支援純文字、JSON 與 JSONL(用於串流處理大型文件)。
  • 分區 OCR:一種進階策略,透過遞迴分割大頁面,恢復標準全頁處理可能遺漏的小文字。
  • 跨套件支援:以 npm 套件形式發佈,內含預先建置的二進位檔,安裝無需 Xcode 或 Swift 工具鏈。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案