dnhkng/GLaDOS

This is the Personality Core for GLaDOS, the first steps towards a real-life implementation of the AI from the Portal series by Valve.

何を解決するか

標準的なLLMを、起動ワードが不要な、視覚・聴覚・発話が可能な能動的なマルチモーダルAIパーソナ(PortalのGLaDOSをモデルに)に変換します。反応的な音声アシスタントの硬い対話の問題を、低遅延パイプラインと自律的な「tick」ループにより解決し、環境のトリガーに基づいてAIが会話を開始できるようにします。

動作方法

このプロジェクトはミンスキーの「心の社会」にインスパイアされたマルチエージェントアーキテクチャを使用しており、視覚、記憶、感情、研究などの専門的なサブエージェントが動的なコンテキストに貢献します。その後、メインエージェントがこのコンテキストを処理して応答を生成します。

主な技術的要素は以下の通りです:

  • 入力パイプライン:音声検出にSilero VAD、音声認識にParakeet ASRを使用。
  • 視覚:シーン理解と変化検出にFastVLMを採用。
  • 自律性:バックグラウンドループが時間、視覚イベント、またはタスク更新に基づいてAIが発話するようにトリガーします。
  • 個性:反応的な気分にPAD(快楽・覚醒・支配)モデルを、安定した性格にHEXACO特性を組み合わせます。
  • ツール:ホームオートメーションやシステム情報のためのModel Context Protocol (MCP) を統合。
  • 出力:低遅延(600ms未満の往復)を最適化したカスタムトレーニング済みTTSモデル(Kokoro)を使用。

対象ユーザー

個性的な身体を持つ自律型AIアシスタントを構築したいAI愛好家や趣味開発者、また低遅延音声/視覚パイプラインやマルチエージェントオーケストレーションに興味を持つ開発者。

特徴

  • 能動的インタラクション:起動ワード不要。AIは観察し、話すべきことがあれば発話します。
  • 低遅延:自然な流れを実現するため、応答時間を600ms未満に最適化したパイプライン。
  • マルチモーダル:カメラ(VLM)とマイク(ASR)を統合し、環境認識を可能に。
  • 拡張可能なツール:MCPによるシステム統計や外部ホームオートメーションへの接続サポート。
  • 感情エンジン:PADモデルに基づく動的な気分変化と、持続的な個性特性。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト