xberg-io/xberg
A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured information from PDFs, Office documents, images, and 98+ formats. Available for Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, R, C, TypeScript (Node/Bun/Wasm/Deno)- or use via CLI, REST API, or MCP server.
해결하는 문제
현대적인 데이터 파이프라인은 PDF 및 스프레드시트부터 오디오 파일과 복잡한 소스 코드에 이르기까지 다양한 파일 형식을 파싱하는 복잡성으로 인해 어려움을 겪는 경우가 많습니다. Xberg는 개발자가 파편화된 라이브러리를 조합하거나 복잡한 OCR 파이프라인을 수동으로 설정할 필요 없이 깨끗하고 구조화된 텍스트와 메타데이터를 추출할 수 있는 통합 엔진을 제공합니다.
작동 방식
Xberg는 단일 코어 엔진을 사용하여 98가지 형식에 대해 지능적인 MIME 탐지 및 추출을 수행합니다. 다음과 같은 다양한 처리 모드를 지원합니다:
- Extraction: 문서를 Markdown 또는 JSON과 같은 구조화된 형식으로 변환합니다.
- OCR & Transcription: 시각적 및 오디오 콘텐츠를 위해 Tesseract, PaddleOCR 또는 Whisper (via ONNX)와 같은 백엔드를 사용합니다.
- Code Intelligence: tree-sitter를 사용하여 306개의 프로그래밍 언어에 대해 구문 인식 청킹 및 심볼 추출을 수행합니다.
- Enrichment: NER, 요약, 번역 및 테이블 추출을 제공합니다.
- Deployment: 라이브러리(15개 언어 바인딩 포함), CLI, REST API 또는 MCP 서버로 작동합니다.
대상 사용자
- AI/LLM 개발자: 구문 인식 코드 청킹 또는 구조화된 문서 인입이 필요한 RAG 파이프라인을 구축하는 개발자.
- 데이터 엔지니어: 대규모 문서 아카이브에서 데이터를 크롤링, 일괄 처리 및 추출하기 위한 자동화된 파이프라인을 구축하는 엔지니어.
- 소프트웨어 엔지니어: 고성능 언어 바인딩을 통해 기존 애플리케이션에 고급 문서 파싱 및 OCR 기능을 통합하려는 엔지니어.
주요 특징
- 방대한 포맷 지원: Office 문서, 이미지, 오디오, 비디오 및 아카이브를 포함한 98가지 형식을 처리합니다.
- 다국어 바인딩: Rust, Python, Node.js, Go, Java, C#, Ruby, PHP, Elixir, Dart, Swift, Zig 및 WASM을 네이티브로 지원합니다.
- RAG 준비 완료: 구문 인식 코드 청킹 및 내장된 embedding/reranking 지원 기능을 갖추고 있습니다.
- 유연한 배포: 로컬 라이브러리, Docker 컨테이너, REST API 또는 Claude나 Cursor와 같은 AI 어시스턴트를 위한 MCP 서버로 실행할 수 있습니다.