BBC-Esq/VectorDB-Plugin
Program that lets you ask questions about your documents, audio, and video files.
解決する課題
このプロジェクトは、さまざまなファイルタイプからローカルのベクトルデータベースを作成する方法を提供し、ユーザーが自分のドキュメント、画像、音声ファイルと対話できるようにし、Retrieval Augmented Generation(RAG)を通じてより信頼性の高い LLM の応答を得られるようにします。
仕組み
システムは以下のパイプラインで入力を処理します:
- インジェスト:ドキュメント(.pdf、.docx、.txt、.html、.md、.csv、.xlsx、.rtf、.eml、.msg)、画像(.png、.jpg、.jpeg、.bmp、.gif、.tif、.tiff)、音声ファイル(.mp3、.wav、.m4a、.ogg、.wma、.flac)など、幅広いフォーマットを受け付けます。
- 処理:ドキュメントからテキストを抽出し、画像の説明を生成し、音声ファイルを文字起こしします。
- 保存:処理されたコンテンツを埋め込みベクトルに変換し、効率的な検索が可能なベクトルデータベースに保存します。
- 検索と生成:ユーザーがテキストまたは音声で質問すると、システムはベクトルデータベースから関連する情報チャンクを取得し、ローカルモデル、Kobold、LM Studio、ChatGPT などの LLM に送って根拠のある回答を生成します。
対象ユーザー
テキスト、画像、音声というマルチモーダルデータからローカルナレッジベースを構築し、LLM のクエリを強化したい Windows ユーザー向けです。
ハイライト
- マルチモーダルインジェスト:多数のドキュメント、画像、音声フォーマットに対応。
- 柔軟な LLM 統合:ローカルモデル、Kobold、LM Studio、ChatGPT と連携可能。
- 音声インタラクション:音声での質問とテキスト‑トゥ‑スピーチによる応答をサポート。
- GUI ベース:管理が容易なグラフィカルユーザーインターフェースを提供。