privatenumber/mac-ocr
macOS CLI for OCR and searchable PDFs using Apple's Vision framework
解决的问题
mac-ocr 是一个 macOS 上的命令行工具和 Node.js API,支持在本地、私有环境下进行 OCR(光学字符识别)。用户无需将数据上传至外部服务器,即可从图像和 PDF 中提取文本,为 AI 代理和人类用户提供了一种免费且私密的云视觉令牌替代方案。
工作原理
该工具是一个原生 Swift 二进制文件,利用 Apple 的 Vision 框架(VNRecognizeTextRequest 和 RecognizeDocumentsRequest)在设备本地处理图像和 PDF。对于可搜索的 PDF,它使用 Core Graphics 和 Core Text 在原始图像上绘制一个不可见的文本层,将文字精确放置在 Vision 框架检测到的位置。
适用人群
- 开发者:希望减少成本,通过本地运行 OCR 而非使用多模态大模型来构建 AI 代理。
- macOS 用户:需要将扫描文档或图像转换为可搜索、可选择的 PDF 或纯文本/JSON 文件的用户。
- Node.js 开发者:希望通过类型化 API 将本地 OCR 功能集成到应用程序中的开发者。
主要亮点
- 隐私优先:完全在设备上运行,无数据上传。
- 可搜索 PDF:将图像或扫描 PDF 转换为带有可选择文本层的 PDF。
- 结构化数据:支持提取段落、表格和列表(macOS 26+)。
- 灵活输出:支持纯文本、JSON 和 JSONL(用于流式处理大文档)。
- 分块 OCR:一种高级策略,通过递归分割大页面,恢复标准全页处理可能遗漏的小文本。
- 跨包支持:以 npm 包形式发布,包含预构建二进制文件,安装无需 Xcode 或 Swift 工具链。
相关
- 项目
- 项目
- 项目
- 项目
- 项目