BBC-Esq/VectorDB-Plugin

Program that lets you ask questions about your documents, audio, and video files.

해결하는 문제

이 프로젝트는 다양한 파일 유형에서 로컬 벡터 데이터베이스를 만드는 방법을 제공하여, 사용자가 자신의 문서, 이미지, 오디오 파일과 대화하고 Retrieval Augmented Generation(RAG)을 통해 보다 신뢰할 수 있는 LLM 응답을 얻을 수 있게 합니다.

작동 방식

시스템은 다음 파이프라인을 통해 입력을 처리합니다:

  1. 인제스트: 문서(.pdf, .docx, .txt, .html, .md, .csv, .xlsx, .rtf, .eml, .msg), 이미지(.png, .jpg, .jpeg, .bmp, .gif, .tif, .tiff), 오디오 파일(.mp3, .wav, .m4a, .ogg, .wma, .flac) 등 다양한 포맷을 받아들입니다.
  2. 처리: 문서에서 텍스트를 추출하고, 이미지에 대한 설명을 생성하며, 오디오 파일을 전사합니다.
  3. 저장: 처리된 콘텐츠를 임베딩하여 벡터 데이터베이스에 저장해 효율적인 검색이 가능하도록 합니다.
  4. 검색 및 생성: 사용자가 텍스트 또는 음성으로 질문하면, 시스템은 벡터 데이터베이스에서 관련 정보를 검색하고 이를 로컬 모델, Kobold, LM Studio, ChatGPT 등 LLM에 전달해 근거 있는 답변을 생성합니다.

대상 사용자

텍스트, 이미지, 오디오와 같은 멀티모달 데이터를 활용해 로컬 지식 베이스를 구축하고 LLM 질의를 강화하고자 하는 Windows 사용자.

주요 특징

  • 멀티모달 인제스트: 다양한 문서, 이미지, 오디오 포맷을 지원합니다.
  • 유연한 LLM 통합: 로컬 모델, Kobold, LM Studio, ChatGPT와 연동 가능합니다.
  • 음성 인터랙션: 음성 질문 및 텍스트‑투‑스피치 응답을 지원합니다.
  • GUI 기반: 관리가 쉬운 그래픽 사용자 인터페이스를 제공합니다.