AlphaAvatar/AlphaAvatar
A real-time interactive Omni Avatar built on LiveKit, which allows you to seamlessly integrate with any open source Avatar components (real-time model, visual, voice, memory, search, etc.).
解決する課題
AlphaAvatar は、プライバシーを最優先にした自己ホスト可能な個人用AIアシスタントを構築するためのフレームワークを提供します。これは「知的な執事」として機能するエージェントを可能にします。単なるチャットボットを越えて、状態保持可能で能動的かつマルチモーダルなエージェントを実現し、ユーザーの好みを記憶し、長期的なタスクを計画し、音声、テキスト、動画などさまざまなチャネルで対話できるようにします。
動作方法
このシステムは、リアルタイムエージェントアーキテクチャをプラグインベースで実装しており、音声、カメラ、画面といったマルチモーダルな観測データをコアの認識レイヤーで処理します。以下の主要モジュールを統合しています:
- メモリとペルソナ:グラフ認識型マルチモーダルメモリと自動ペルソナ抽出により、アイデンティティの継続性とユーザー理解を維持します。
- インタラクションルーター:リアルタイム音声ルーティング、発話の順番管理、割り込み処理を管理します。
- ツール統合:MCP(Model Context Protocol)、RAGによるドキュメント検索、DeepResearchによるウェブ検索を通じて外部世界と接続します。
- バーチャルキャラクター:リアルタイム対話用のアシスタントの視覚的表現を提供します。
- インフラストラクチャ:さまざまなLLMプロバイダーとストレージバックエンド(LanceDBやQdrantなど)に接続し、ベクトルデータおよびアイデンティティデータを管理します。
対象ユーザー
個人のライフメトリクスを管理し、知識を整理し、タスクをスケジューリングし、自律的な多ステップワークフローを実行できる、高度にカスタマイズ可能な自己ホスト型AIコンパニオンを求める開発者やユーザー向けです。
特徴
- プライバシー最優先:完全に自己ホスト可能で、ユーザーがデータとメモリの完全な制御権を保持できます。
- マルチモーダル対話:専用のバーチャルキャラクターインターフェースを備えたリアルタイム音声、テキスト、カメラ入力をサポートします。
- 能動的計画:タスク分解、リマインダー、長期的な目標実行のためのモジュールを備えています。
- 拡張可能なツールセット:MCPで外部APIと統合し、RAGで個人の知識ベースを活用できます。
- 多様なアクセスチャネル:Webデモ、LiveKitプレイグラウンド、WhatsAppなどのメッセージングプラットフォームから利用可能です。
関連
- プロジェクト
KevinLiss/ApeAdminApeAdminは、AIアプリケーション向けに調整された、オープンソースのFastAPI + Vue 3管理フレームワークです。WordPressスタイルのインストールウィザード、完全なRBAC、プラグイン・アーキテクチャ、およびバックエンド関数をLLMエージェントが呼び出せるツールへと変換するMCP-SSEゲートウェイを備えています。組み込みのマルチモデル・チャット、監査ログ、およびプラグイン・マーケットプレイスにより、追加のAPIを書くことなく、安全な管理UIを構築し、ビジネスロジックをAIエージェントに公開することができます。
- プロジェクト
RTGS2017/NagaAgentNagaAgentは、Windows/macOS/Linux対応のクロスプラットフォームデスクトップAIアシスタントです。OpenAI互換LLMとのチャット、JSONブロックによるカスタムツール呼び出し、Neo4jに保存されたグラフRAGメモリ、Live2Dアニメーションアバター、リップシンク付き音声合成/認識、天気・Web検索・ゲームガイドなどに対応するプラグインMCPフレームワーク、およびフォーラムやスキルマーケットといったコミュニティ機能を備えています。Electron/Vueフロントエンド+Python FastAPIバックエンドで構成され、`uv sync`(またはpip)でインストール可能。AGPL-3.0+独自商用ライセンスの二重ライセンスです。
- プロジェクト
dromara/wgaiWGAI は、Spring-Boot + Vue で構築されたウェブプラットフォームで、ビジョン(OpenCV、YOLO、OCR、顔認識)、オーディオ(音声認識、ChatGPT風の対話)、デジタル人間アバター、AGVナビゲーションをオフライン優先、産業用レベルのAI管理システムとして統合しています。オンラインデータアノテーション、モデル学習、リアルタイム動画/音声分析、システム監視を提供し、設定用UIとパブリックデモインスタンスも備えています。コードは AGPL-3.0、サポートは主に有料の中国語コミュニティを通じて提供されています。
- Dispatch
ChatGPT プラグインのリリースOpenAI は ChatGPT 用のプラグインを導入し、モデルがリアルタイム情報にアクセスし、計算を実行し、サードパーティサービスと統合できるようにすることで、ユーティリティを拡大し、幻覚(ハルシネーション)を減らします。
- プロジェクト
lc2panda/alphastreamAlphastreamはAI駆動の金融分析Webアプリです。DeepSeek/任意のOpenAI互換LLMとLangGraphを用いて、14の専門エージェント(テクニカル、ファンダメンタル、センチメント、リスクなど)および4つの投資家ペルソナエージェントを実行します。中国、米国、香港、暗号資産、マクロデータをカバーする二重アダプタ(AKShare & BaoStock)からリアルタイム市場データを取得。Next.js + ReactによるフロントエンドはダークグラスモルフィズムUIを採用し、チャット、ダッシュボード、チャートカードを提供。FlaskバックエンドはSSEでエージェントの進行状況をストリーミング。すべてのサービスは1つのDocker-Composeコマンドで起動可能。