dnhkng/GLaDOS
This is the Personality Core for GLaDOS, the first steps towards a real-life implementation of the AI from the Portal series by Valve.
何を解決するか
標準的なLLMを、起動ワードが不要な、視覚・聴覚・発話が可能な能動的なマルチモーダルAIパーソナ(PortalのGLaDOSをモデルに)に変換します。反応的な音声アシスタントの硬い対話の問題を、低遅延パイプラインと自律的な「tick」ループにより解決し、環境のトリガーに基づいてAIが会話を開始できるようにします。
動作方法
このプロジェクトはミンスキーの「心の社会」にインスパイアされたマルチエージェントアーキテクチャを使用しており、視覚、記憶、感情、研究などの専門的なサブエージェントが動的なコンテキストに貢献します。その後、メインエージェントがこのコンテキストを処理して応答を生成します。
主な技術的要素は以下の通りです:
- 入力パイプライン:音声検出にSilero VAD、音声認識にParakeet ASRを使用。
- 視覚:シーン理解と変化検出にFastVLMを採用。
- 自律性:バックグラウンドループが時間、視覚イベント、またはタスク更新に基づいてAIが発話するようにトリガーします。
- 個性:反応的な気分にPAD(快楽・覚醒・支配)モデルを、安定した性格にHEXACO特性を組み合わせます。
- ツール:ホームオートメーションやシステム情報のためのModel Context Protocol (MCP) を統合。
- 出力:低遅延(600ms未満の往復)を最適化したカスタムトレーニング済みTTSモデル(Kokoro)を使用。
対象ユーザー
個性的な身体を持つ自律型AIアシスタントを構築したいAI愛好家や趣味開発者、また低遅延音声/視覚パイプラインやマルチエージェントオーケストレーションに興味を持つ開発者。
特徴
- 能動的インタラクション:起動ワード不要。AIは観察し、話すべきことがあれば発話します。
- 低遅延:自然な流れを実現するため、応答時間を600ms未満に最適化したパイプライン。
- マルチモーダル:カメラ(VLM)とマイク(ASR)を統合し、環境認識を可能に。
- 拡張可能なツール:MCPによるシステム統計や外部ホームオートメーションへの接続サポート。
- 感情エンジン:PADモデルに基づく動的な気分変化と、持続的な個性特性。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト