BBC-Esq/VectorDB-Plugin

Program that lets you ask questions about your documents, audio, and video files.

它解決了什麼問題

此專案提供了一種從各種檔案類型建立本地向量資料庫的方法,讓使用者能與自己的文件、圖像與音訊檔案對話,透過檢索增強生成(RAG)獲得更可靠的 LLM 回應。

它如何運作

系統透過以下流程處理輸入:

  1. 資料攝取:接受廣泛的格式,包括文件(.pdf、.docx、.txt、.html、.md、.csv、.xlsx、.rtf、.eml、.msg)、圖像(.png、.jpg、.jpeg、.bmp、.gif、.tif、.tiff)以及音訊檔案(.mp3、.wav、.m4a、.ogg、.wma、.flac)。
  2. 處理:從文件中抽取文字,為圖像產生描述,並將音訊檔案轉寫為文字。
  3. 儲存:將處理過的內容嵌入向量並儲存至向量資料庫,以便高效搜尋。
  4. 檢索與生成:當使用者以文字或語音提出問題時,系統會從向量資料庫檢索相關資訊片段,並將其送至 LLM(如本機模型、Kobold、LM Studio 或 ChatGPT)產生有根據的答案。

目標使用者

想在 Windows 上從多模態資料(文字、圖像、音訊)建立本地知識庫,並用於增強 LLM 查詢的使用者。

重點特色

  • 多模態資料攝取:支援大量文件、圖像與音訊格式。
  • 彈性 LLM 整合:相容本機模型、Kobold、LM Studio 與 ChatGPT。
  • 語音互動:支援語音提問與文字轉語音回覆。
  • 圖形介面:提供圖形使用者介面,讓管理更簡便。