AnubhavChaturvedi-GitHub/jarvis-ai-assistant
Voice-controlled AI desktop assistant in Python. Speech recognition, text to speech, real-time web search, image generation, computer vision and WhatsApp automation, inspired by Iron Man's JARVIS.
解決する課題
J.A.R.V.I.Sは、自然な音声インターフェースを通じてコンピュータ作業を自動化し、情報を提供する音声制御型デスクトップアシスタントです。ユーザーが音声コマンドでシステムを制御し、AI機能にアクセスできるようにすることで、手動でのタイピングやクリックの必要性を排除します。
仕組み
このシステムは、異なるモダリティを処理する交換可能なサブシステムの集合体として構築されています。中心となるエントリポイント(jarvis.py)が、ユーザーの意図を特定のモジュールにルーティングします:
- 音声処理: カスタムの音声文字変換エンジン(
NetHyTechSTT)と、音声返答用のテキスト読み上げモジュールを使用します。 - 推論:
Brain(co_brain.py)が会話のメモリと言語モデルの推論を管理します。 - 機能: 専用のモジュールが、ライブウェブ検索、画像生成、カメラベースの画像理解(Vision)、およびデスクトップ自動化(アプリの起動やシステムタスクの実行)を処理します。
- 統合: ブラウザとWhatsAppの自動化には Selenium と PyWhatKit を使用します。
対象ユーザー
デスクトップ用にアイアンマンにインスパイアされたハンズフリーAIアシスタントを求めるユーザーや、新しい機能を拡張するためのモジュール式Pythonベースのアシスタントフレームワークを探している開発者。
ハイライト
- モジュール式アーキテクチャ: サブシステムが分離されているため、ユーザーは必要な部分だけを使用できます。
- マルチモーダル機能: 音声、テキスト、画像生成、コンピュータビジョンを組み合わせています。
- オフライン対応: 有料APIを必要としないカスタム音声文字変換エンジンが含まれています。
- システム自動化: デスクトップを制御し、アプリケーションを開き、ハンズフリーでWhatsAppメッセージを送信できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト