HKUDS/RAG-Anything
"RAG-Anything: All-in-One RAG Framework"
해결하는 문제
기존 RAG 시스템은 주로 텍스트 중심이며, 이미지, 표, 수학식이 혼합된 문서를 처리하는 데 어려움을 겪습니다. RAG-Anything은 단일 시스템 내에서 텍스트, 이미지, 표, 수식 등 모든 모달리티를 원활하게 처리하고 질의할 수 있는 종합적인 프레임워크를 제공하여 별도의 전문 도구를 여러 개 사용할 필요를 없앱니다.
작동 방식
LightRAG 기반의 다단계 다모달 파이프라인을 구현합니다:
- 문서 파싱: PDF, Office 문서, 이미지에서 텍스트, 시각적 요소, 표를 고정밀도로 추출하기 위해 MinerU를 사용합니다.
- 콘텐츠 분석: 콘텐츠를 자동으로 분류하고, 전용 분석기(예: 이미지용 Visual Content Analyzer, 표용 Structured Data Interpreter, LaTeX 수식용 Mathematical Expression Parser)로 라우팅합니다.
- 지식 그래프 인덱싱: 다모달 요소를 구조화된 엔티티로 변환하고, 모달리티 간의 관계를 맵핑하여 원본 문서의 계층 구조를 유지합니다.
- 모달리티 인식 검색: 벡터 유사도 검색과 그래프 탐색을 결합하여 콘텐츠를 검색하며, 질의의 모달리티 선호도에 따라 적응형 랭킹을 사용해 결과를 가중치 처리합니다.
대상 사용자
이 도구는 학술 연구, 기술 문서, 재무 보고서, 기업 지식 관리 등 풍부한 혼합 콘텐츠 문서를 다루는 사용자에게 적합합니다.
주요 특징
- 엔드투엔드 파이프라인: 인게스트 및 파싱부터 다모달 질의 응답까지 모든 과정을 처리합니다.
- 유니버설 포맷 지원: PDF, Office 파일(DOCX, PPTX, XLSX), 이미지를 처리할 수 있습니다.
- 다모달 지식 그래프: 엔티티를 자동으로 추출하고, 다양한 콘텐츠 유형 간의 관계를 탐지합니다.
- VLM 강화 질의: 비전 언어 모델(VLM)을 통합하여 이미지와 텍스트 맥락을 함께 분석해 깊이 있는 인사이트를 제공합니다.
- 하이브리드 검색: 벡터 검색과 그래프 탐색을 융합하여 더 포괄적인 정보 복구를 가능하게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트