BBC-Esq/VectorDB-Plugin
Program that lets you ask questions about your documents, audio, and video files.
해결하는 문제
이 프로젝트는 다양한 파일 유형에서 로컬 벡터 데이터베이스를 만드는 방법을 제공하여, 사용자가 자신의 문서, 이미지, 오디오 파일과 대화하고 Retrieval Augmented Generation(RAG)을 통해 보다 신뢰할 수 있는 LLM 응답을 얻을 수 있게 합니다.
작동 방식
시스템은 다음 파이프라인을 통해 입력을 처리합니다:
- 인제스트: 문서(.pdf, .docx, .txt, .html, .md, .csv, .xlsx, .rtf, .eml, .msg), 이미지(.png, .jpg, .jpeg, .bmp, .gif, .tif, .tiff), 오디오 파일(.mp3, .wav, .m4a, .ogg, .wma, .flac) 등 다양한 포맷을 받아들입니다.
- 처리: 문서에서 텍스트를 추출하고, 이미지에 대한 설명을 생성하며, 오디오 파일을 전사합니다.
- 저장: 처리된 콘텐츠를 임베딩하여 벡터 데이터베이스에 저장해 효율적인 검색이 가능하도록 합니다.
- 검색 및 생성: 사용자가 텍스트 또는 음성으로 질문하면, 시스템은 벡터 데이터베이스에서 관련 정보를 검색하고 이를 로컬 모델, Kobold, LM Studio, ChatGPT 등 LLM에 전달해 근거 있는 답변을 생성합니다.
대상 사용자
텍스트, 이미지, 오디오와 같은 멀티모달 데이터를 활용해 로컬 지식 베이스를 구축하고 LLM 질의를 강화하고자 하는 Windows 사용자.
주요 특징
- 멀티모달 인제스트: 다양한 문서, 이미지, 오디오 포맷을 지원합니다.
- 유연한 LLM 통합: 로컬 모델, Kobold, LM Studio, ChatGPT와 연동 가능합니다.
- 음성 인터랙션: 음성 질문 및 텍스트‑투‑스피치 응답을 지원합니다.
- GUI 기반: 관리가 쉬운 그래픽 사용자 인터페이스를 제공합니다.