privatenumber/mac-ocr

macOS CLI for OCR and searchable PDFs using Apple's Vision framework

何を解決するか

mac-ocr は macOS 上でローカルかつプライベートな OCR(光学式文字認識)を可能にするコマンドラインツールおよび Node.js API です。データを外部サーバーにアップロードせずに、画像や PDF からテキストを抽出できます。AIエージェントや人間ユーザーにとって、クラウドベースのビジョントークンの無料かつプライベートな代替手段を提供します。

動作方法

このツールは Apple の Vision フレームワーク(VNRecognizeTextRequest および RecognizeDocumentsRequest)を活用するネイティブ Swift バイナリです。画像や PDF をデバイス上でローカルに処理します。検索可能な PDF を作成する際には、Core Graphics と Core Text を使って、Vision フレームワークが検出した位置に正確にテキストレイヤーを非表示で重ねます。

対象ユーザー

  • 開発者:マルチモーダル LLM を使用する代わりに、ローカルで OCR を実行することでコストを削減したい AI エージェントの開発者。
  • macOS ユーザー:スキャンされた文書や画像を検索可能で選択可能な PDF やプレーンテキスト/JSON ファイルに変換したいユーザー。
  • Node.js 開発者:タイプ付き API を通じてアプリケーションにローカル OCR 機能を統合したい開発者。

特徴

  • プライバシー最優先:データのアップロードなしにデバイス上で完全に動作。
  • 検索可能な PDF:画像やスキャンされた PDF を選択可能なテキストレイヤー付き PDF に変換。
  • 構造化データ:パラグラフ、テーブル、リストの抽出をサポート(macOS 26+ 以上)。
  • 柔軟な出力形式:プレーンテキスト、JSON、JSONL(大規模ドキュメントのストリーミング対応)をサポート。
  • パーティショニング OCR:大規模なページを再帰的に分割する高度な戦略。標準的なフルページ処理では見逃されがちな小さなテキストを回復可能。
  • クロスパッケージ対応:npm パッケージとして配布され、事前ビルド済みバイナリを含み、Xcode や Swift ツールチェインのインストール不要。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト