uezo/ChatdollKit

ChatdollKit enables you to make your 3D model into a chatbot

何を解決するか

ChatdollKit は 3D バーチャルアシスタント SDK であり、開発者が 3D モデル(特に VRM モデル)を音声対応のインタラクティブなチャットボットに変換できるようにします。大規模言語モデル(LLM)と 3D アバターの間のギャップを埋め、AI が生成したテキストをリアルタイムで音声、リップシンク、表情、身体アニメーションと同期します。

動作方法

この SDK は Unity ベースのワークフローに複数の AI コンポーネントを統合しています:

  • LLM 統合:ChatGPT、Claude、Gemini、Dify などのサービスに接続し、会話応答を生成します。関数呼び出しとマルチモーダル機能をサポートしています。
  • 音声パイプライン:音声認識(STT)で聞き取り(例:OpenAI、Azure、Google)を行い、音声合成(TTS)で発話(例:VOICEVOX、Style-Bert-VITS2)を行います。話者検出(VAD)を含み、ターンチェンジとノイズ耐性を処理します。
  • アバター制御ModelController が 3D モデルの状態を管理し、LLM の応答に埋め込まれたタグ(例:[face:Joy])に基づいて表情やアニメーションをトリガーします。
  • 同期:音声出力をリップシンクと自律的な瞬きと同期させ、現実的な存在感を実現します。

対象ユーザー

  • Unity 開発者:バーチャルエージェント、AI ヴチューバー、インタラクティブな NPC を構築したい人。
  • アプリ開発者:VR、AR、WebGL アプリケーションを構築し、会話型の 3D インターフェースを必要とする人。
  • AI 研究者/趣味人:LLM を視覚的で感情豊かな 3D キャラクターとして具現化したい人。

特徴

  • マルチプラットフォーム対応:Windows、Mac、Linux、iOS、Android、VR、AR、WebGL に対応。
  • 自然なインタラクション:「バージンイン」(AI の発話途中での中断)と WebSocket ストリーミング STT をサポートし、レイテンシを低減。
  • 感情制御:会話の文脈に基づいて、音声スタイル、表情、ジェスチャーを自律的に切り替え。
  • 記憶と状態:会話履歴の長期記憶と動的な多言語切り替えをサポート。
  • エージェント機能:Dify および AIAvatarKit との統合により、ツール呼び出し機能を持つ AI エージェントとしての動作が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト