BBC-Esq/VectorDB-Plugin

Program that lets you ask questions about your documents, audio, and video files.

解決する課題

このプロジェクトは、さまざまなファイルタイプからローカルのベクトルデータベースを作成する方法を提供し、ユーザーが自分のドキュメント、画像、音声ファイルと対話できるようにし、Retrieval Augmented Generation(RAG)を通じてより信頼性の高い LLM の応答を得られるようにします。

仕組み

システムは以下のパイプラインで入力を処理します:

  1. インジェスト:ドキュメント(.pdf、.docx、.txt、.html、.md、.csv、.xlsx、.rtf、.eml、.msg)、画像(.png、.jpg、.jpeg、.bmp、.gif、.tif、.tiff)、音声ファイル(.mp3、.wav、.m4a、.ogg、.wma、.flac)など、幅広いフォーマットを受け付けます。
  2. 処理:ドキュメントからテキストを抽出し、画像の説明を生成し、音声ファイルを文字起こしします。
  3. 保存:処理されたコンテンツを埋め込みベクトルに変換し、効率的な検索が可能なベクトルデータベースに保存します。
  4. 検索と生成:ユーザーがテキストまたは音声で質問すると、システムはベクトルデータベースから関連する情報チャンクを取得し、ローカルモデル、Kobold、LM Studio、ChatGPT などの LLM に送って根拠のある回答を生成します。

対象ユーザー

テキスト、画像、音声というマルチモーダルデータからローカルナレッジベースを構築し、LLM のクエリを強化したい Windows ユーザー向けです。

ハイライト

  • マルチモーダルインジェスト:多数のドキュメント、画像、音声フォーマットに対応。
  • 柔軟な LLM 統合:ローカルモデル、Kobold、LM Studio、ChatGPT と連携可能。
  • 音声インタラクション:音声での質問とテキスト‑トゥ‑スピーチによる応答をサポート。
  • GUI ベース:管理が容易なグラフィカルユーザーインターフェースを提供。