emcf/thepipe

Get clean data from tricky documents, powered by vision-language models ⚡

해결하는 문제

복잡하고 "어려운" 문서에서 깨끗하고 구조화된 데이터 및 다중 모달 콘텐츠(텍스트, 이미지, 오디오, 비디오)를 추출하는 과정을 단순화합니다. PDF, PowerPoint, Jupyter 노트북과 같은 다양한 파일 형식을 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)이 쉽게 사용할 수 있는 형식으로 변환하는 문제를 해결합니다.

작동 방식

이 도구는 컴퓨터 비전 모델, 히ュ리스틱, VLM의 조합을 사용하여 문서 레이아웃을 분석하고 콘텐츠를 스크래핑합니다. Whisper를 사용하여 오디오 및 비디오를 음성 인식하고, 이미지에 대해 OCR을 수행합니다. 추출된 콘텐츠는 페이지, 길이, 섹션, 키워드, 또는 의미적으로 분할하는 다양한 청킹 방법으로 처리되어 모델의 토큰 제한에 맞게 조정됩니다. OpenAI 호환 API에 직접 통합되며, 스크래핑된 데이터를 채팅 메시지나 LlamaIndex 문서로 변환하는 유틸리티도 제공합니다.

대상 사용자

RAG(검색 증강 생성) 파이프라인, AI 에이전트, 또는 LLM과 함께 사용하기 위해 다양한 비구조화 파일 형식에서 고품질 데이터 추출이 필요한 애플리케이션을 개발하는 개발자들입니다.

주요 특징

  • 다중 모달 지원: PDF, Word 문서, PPT, 노트북에서 텍스트, 표, 이미지를 추출하고 오디오/비디오를 음성 인식합니다.
  • VLM 기반 추출: 시각-언어 모델을 사용하여 우수한 출력 품질과 레이아웃 분석을 제공합니다.
  • 유연한 청킹: 의미적 및 에이전트 기반 청킹을 포함한 다양한 전략을 제공하여 의미 있는 맥락을 유지합니다.
  • 광범위한 호환성: OpenAI, OpenRouter, 로컬 VLM 서버(예: OpenLLM), LlamaIndex와 즉시 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트