magicrew/doc7
Turn documents into AI-ready Markdown with visual understanding
解決的問題
doc7 是一個文件轉換工具,可將複雜的文件(包括 PDF、Office 檔案、掃描件、截圖、圖表和圖示)轉換為 AI 友好的 Markdown。它解決了傳統 OCR 或文字提取過程中結構與視覺資訊(如公式、表格和圖示關係)遺失的問題,使文件對 AI 模型更易於搜尋與推理。
工作原理
doc7 不依賴傳統的 OCR 堆疊或特定檔案格式的解析器,而是採用全頁面視覺理解的方法。它將文件頁面渲染為影像,並透過 OpenAI 相容的多模態(視覺)模型進行處理。這使得工具能重建頁面內容,包含視覺元素,並以 Markdown 格式輸出。使用者可透過 LM Studio 或 Ollama 在本地執行這些模型,以保護隱私並消除按頁計費的 API 成本。
適用對象
- AI 開發者:建構 RAG 流水線,需要從多種文件格式中取得高品質、結構化 Markdown 的開發者。
- 重視隱私的使用者:希望使用本地視覺模型處理文件,避免將資料傳送至雲端 API 的個人或組織。
- 自托管使用者:希望消除雲端服務提供者持續文件解析費用的使用者。
核心亮點
- 多模態流程:對所有格式(PDF、Office、影像)使用單一視覺理解流程,無需獨立的 OCR/版面模型。
- 本地模型支援:相容任何 OpenAI 相容的多模態模型,包括透過 Ollama 或 LM Studio 部署的本地模型。
- 零邊際成本:使用本地硬體時,無需支付每頁費用或文件積分。
- 強大的恢復能力:支援失敗頁面的復原與使用不同模型重新處理特定頁面。
- 多功能介面:提供跨平台 CLI、Go SDK、MCP 工具以及非同步 HTTP 服務。
相關
- 專案
- 專案
- 專案
- 專案
- 專案