Lynpoint/CyberVerse

Self hosted, real-time digital human agent platform. Build voice-first AI agents with WebRTC, persona memory, tools, RAG, and optional digital-human video.

解決する課題

CyberVerseは、リアルタイムで音声駆動のデジタルヒューマンエージェントを作成するために設計されています。ユーザーは1枚の写真を、リアルタイムで見たり聞いたり話したりできる生きたAIキャラクターに変えることができ、テキストベースのチャットボットよりも自然で人間らしい対話体験を提供します。

仕組み

このフレームワークはモジュール式のプラグインベースのアーキテクチャを採用しており、「脳」(LLM)、音声(TTS)、聴覚(ASR)、顔(アバターモデル)のコンポーネントを交換できます。流暢な会話を担当するフォアグラウンドのPersonaAgentと、調査やレポート生成などの複雑な非同期タスクを担当するバックグラウンドのSubAgentsからなるマルチエージェントシステムを利用します。視覚コンポーネントには、FlashHeadやLiveActなどのローカルモデル、またはクラウドAPI(Baidu Xiling、Xunfei)を統合し、WebRTCを介して結果をストリーミングすることで、低遅延で全二重の対話を実現します。

対象ユーザー

音声とビデオ機能を統合したインタラクティブなデジタルヒューマン、仮想アシスタント、またはキャラクターベースのAIエージェントを構築したい開発者やAI愛好家を対象としています。

ハイライト

  • 単一写真アニメーション: たった1枚の画像からリアルタイムのデジタルヒューマンを作成します。
  • 全二重対話: ユーザーがリアルタイムでAIを中断できる自然な会話をサポートします。
  • マルチエージェントアーキテクチャ: PersonaAgentとSubAgentsにより、会話の流暢さと重いバックグラウンド処理を分離します。
  • RAG統合: ナレッジベースや伝記資料をインポートして、AIの応答を特定のキャラクターのペルソナに合わせることができます。
  • モジュール式スタック: LiteLLMを介した100以上のプロバイダーへの対応を含め、さまざまなLLM、TTS、ASRプロバイダーを簡単に切り替えられます。
  • 柔軟なデプロイ: 利用可能なGPUリソースに応じて、純粋な音声エージェントまたはフルデジタルヒューマンビデオエージェントとして実行できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト