lumina-ai-inc/chunkr
Vision infrastructure to turn complex documents into RAG/LLM-ready data
解決的問題
Chunkr 是一個文件智能 API,專門用於將 PDF、PowerPoint 簡報、Word 文件和影像等複雜文件轉換為結構化、LLM 就緒的區塊。它透過處理版面分析、OCR 和語意分塊,解決為檢索增強生成(RAG)流程準備高品質資料的問題。
工作原理
此專案提供一個可投入生產的服務,透過版面分析、OCR(含邊界框)以及視覺語言模型(VLM)處理的流程來處理文件。它將原始檔案轉換為結構化的 HTML 與 Markdown 格式,再進行語意分塊,以供 LLM 使用。開源版本使用社群與開源模型完成這些任務,而管理型雲端 API 版本則使用專有模型以達成更高準確度。
適用對象
適合需要自動化處理各種檔案格式之文件解析與區塊化流程的開發者與 AI 工程師,用於建構 RAG 應用程式。
主要特色
- 多格式支援:支援處理 PDF、PPT、Word 文件與影像。
- 結構化輸出:產生 HTML 與 Markdown,更適合 LLM 消費。
- 版面分析:執行含邊界框的版面分析與 OCR。
- 彈性 LLM 設定:透過
models.yaml設定檔支援多種 LLM 提供商(OpenAI、Google AI Studio、OpenRouter,以及 vLLM 或 Ollama 等自架選項)。 - Docker 就緒:支援 GPU、僅 CPU 與 Mac ARM 架構,可透過 Docker Compose 輕鬆部署。
相關
- 專案
- 專案
- 專案
- 專案