xberg-io/xberg
A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured information from PDFs, Office documents, images, and 98+ formats. Available for Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, R, C, TypeScript (Node/Bun/Wasm/Deno)- or use via CLI, REST API, or MCP server.
解決的問題
現代數據流水線經常面臨解析多樣化檔案格式的複雜性,範圍涵蓋從 PDF 和試算表到音訊檔案和複雜的原始碼。Xberg 提供了一個統一的引擎,無需開發人員手動組裝碎片化的函式庫或設定複雜的 OCR 流水線,即可提取乾淨、結構化的文本和元數據。
工作原理
Xberg 使用單一核心引擎在 98 種格式中執行智慧 MIME 檢測與提取。它支援多種處理模式,包括:
- Extraction: 將文件、圖像、音訊和程式碼轉換為 Markdown 或 JSON 等結構化格式。
- OCR & Transcription: 使用 Tesseract、PaddleOCR 或 Whisper (via ONNX) 等後端處理視覺與音訊內容。
- Code Intelligence: 利用 tree-sitter 對 306 種程式語言進行語法感知分塊與符號提取。
- Enrichment: 提供 NER、摘要、翻譯和表格提取。
- Deployment: 作為函式庫(具有 15 種語言綁定)、CLI、REST API 或 MCP 伺服器運行。
適用對象
- AI/LLM 開發人員: 構建需要語法感知程式碼分塊或結構化文件攝取的 RAG 流水線。
- 數據工程師: 構建用於從海量文件存檔中爬取、批次處理和提取數據的自動化流水線。
- 軟體工程師: 透過高效能語言綁定將進階文件解析和 OCR 功能整合到現有應用程式中。
亮點
- 海量格式支援: 處理包括 Office 文件、圖像、音訊、影片和壓縮檔在內的 98 種格式。
- 多語言綁定: 原生支援 Rust, Python, Node.js, Go, Java, C#, Ruby, PHP, Elixir, Dart, Swift, Zig 和 WASM。
- RAG 就緒: 具有語法感知程式碼分塊和內建的 embedding/reranking 支援。
- 靈活部署: 可以作為本地函式庫、Docker 容器、REST API 或用於 Claude 或 Cursor 等 AI 助手的 MCP 伺服器運行。