diegomarzaa/pdf-ocr-obsidian
Convert your PDFs into Markdown files easily with Mistral OCR Software
解決的問題
自動化將PDF文件轉換為結構化Markdown檔案,特別針對Obsidian使用進行優化。解決手動從掃描PDF中提取文字與圖片的問題,同時維持文件層級結構與圖片參考。
工作原理
此工具使用Mistral AI OCR API處理PDF。它會掃描指定的輸入資料夾中的檔案,上傳至API,然後解析回應以建立Markdown檔案。圖片會被分開提取,並使用Obsidian風格的wikilink(![[image-name]])在文字中連結。為避免重複的API呼叫,系統會將原始OCR回應快取為JSON檔案。
適用對象
希望將掃描PDF內容導入知識庫,同時保留圖片與結構的Obsidian使用者。
特色
- 批次處理:自動處理資料夾中的多個PDF。
- Obsidian整合:使用wikilink連結圖片,確保與Obsidian倉庫的相容性。
- 彈性介面:提供本地Web應用程式與Jupyter Notebook兩種形式。
- OCR快取:將API回應儲存為JSON以避免重複成本或呼叫。
相關
- 專案
- 專案
- 專案
- 專案