privatenumber/mac-ocr
macOS CLI for OCR and searchable PDFs using Apple's Vision framework
何を解決するか
mac-ocr は macOS 上でローカルかつプライベートな OCR(光学式文字認識)を可能にするコマンドラインツールおよび Node.js API です。データを外部サーバーにアップロードせずに、画像や PDF からテキストを抽出できます。AIエージェントや人間ユーザーにとって、クラウドベースのビジョントークンの無料かつプライベートな代替手段を提供します。
動作方法
このツールは Apple の Vision フレームワーク(VNRecognizeTextRequest および RecognizeDocumentsRequest)を活用するネイティブ Swift バイナリです。画像や PDF をデバイス上でローカルに処理します。検索可能な PDF を作成する際には、Core Graphics と Core Text を使って、Vision フレームワークが検出した位置に正確にテキストレイヤーを非表示で重ねます。
対象ユーザー
- 開発者:マルチモーダル LLM を使用する代わりに、ローカルで OCR を実行することでコストを削減したい AI エージェントの開発者。
- macOS ユーザー:スキャンされた文書や画像を検索可能で選択可能な PDF やプレーンテキスト/JSON ファイルに変換したいユーザー。
- Node.js 開発者:タイプ付き API を通じてアプリケーションにローカル OCR 機能を統合したい開発者。
特徴
- プライバシー最優先:データのアップロードなしにデバイス上で完全に動作。
- 検索可能な PDF:画像やスキャンされた PDF を選択可能なテキストレイヤー付き PDF に変換。
- 構造化データ:パラグラフ、テーブル、リストの抽出をサポート(macOS 26+ 以上)。
- 柔軟な出力形式:プレーンテキスト、JSON、JSONL(大規模ドキュメントのストリーミング対応)をサポート。
- パーティショニング OCR:大規模なページを再帰的に分割する高度な戦略。標準的なフルページ処理では見逃されがちな小さなテキストを回復可能。
- クロスパッケージ対応:npm パッケージとして配布され、事前ビルド済みバイナリを含み、Xcode や Swift ツールチェインのインストール不要。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト