emcf/thepipe
Get clean data from tricky documents, powered by vision-language models ⚡
解決的問題
簡化從複雜且「棘手」的文件中提取乾淨、結構化資料與多模態內容(文字、圖片、音訊、影片)的流程。解決將多樣檔案格式(如 PDF、PowerPoint、Jupyter Notebook)轉換為大型語言模型(LLM)與視覺語言模型(VLM)易於處理的格式的問題。
如何運作
此工具結合使用電腦視覺模型、啟發式方法與 VLM 來分析文件版面並抓取內容。使用 Whisper 進行音訊與影片轉錄,並對圖片執行 OCR。提取的內容可透過多種分塊方式(按頁、長度、章節、關鍵字或語意)處理,以符合模型的 token 限制。可直接整合至 OpenAI 相容 API,並提供將抓取資料轉換為聊天訊息或 LlamaIndex 文件的實用工具。
適用對象
開發 RAG(檢索增強生成)管道、AI 代理,或任何需要從各種非結構化檔案類型中提取高品質資料以供 LLM 使用的開發者。
主要特色
- 多模態支援:從 PDF、Word 文件、PPT 和筆記本中提取文字、表格與圖片,並轉錄音訊/影片。
- VLM 驅動的提取:使用視覺語言模型實現更優的輸出品質與版面分析。
- 彈性分塊:提供多種策略,包括語意與代理式分塊,以維持有意義的上下文。
- 廣泛相容性:開箱即用支援 OpenAI、OpenRouter、本地 VLM 伺服器(如 OpenLLM)與 LlamaIndex。
相關
- 專案
- 專案
- 專案
- 專案