docling-project/docling
Get your documents ready for gen AI
解決的問題
Docling 簡化了將多樣且複雜的文件格式轉換為適合生成式 AI 應用的結構化、機器可讀格式的流程。它解決了 LLM 通常難以直接處理的高階 PDF 排版、表格以及多模態內容(如影像與音訊)的解析挑戰。
作法原理
Docling 使用稱為 DoclingDocument 的統一文件表示格式,解析多種檔案類型——包括 PDF、Office 文件、HTML,甚至影片/音訊檔案——並導出為 Markdown 或 JSON 等格式。它利用 OCR 處理掃描文件,使用視覺語言模型(VLM)理解複雜排版,並以自動語音辨識(ASR)處理音訊/影片字幕。
適用對象
專為開發 AI 代理、RAG(檢索增強生成)管道與文件處理工作流程的開發者設計,適用於需要將非結構化文件轉換為乾淨結構化資料的場景。
主要亮點
- 多模態解析:支援廣泛的格式,包括 PDF、DOCX、PPTX、XLSX、HTML、EPUB、郵件格式,以及影片/音訊檔案。
- 高階 PDF 理解:可處理頁面排版、閱讀順序、表格結構與公式。
- AI 生態系整合:原生支援 LangChain、LlamaIndex、Crew AI 與 Haystack。
- 本地執行:可在本地執行,適用於敏感資料與離線環境(空氣隔離)。
- 圖表理解:將長條圖、圓餅圖、折線圖等轉換為表格或程式碼,並附上詳細描述。
- 彈性匯出:支援匯出為 Markdown、HTML、JSON,以及 USPTO 與 JATS 等特定 XML 模式。
相關
- 專案
- 專案
- 專案
- 專案
- 專案