uezo/ChatdollKit

ChatdollKit enables you to make your 3D model into a chatbot

解決的問題

ChatdollKit 是一個 3D 虛擬助手 SDK,讓開發者能將 3D 模型(特別是 VRM 模型)轉換為具備語音功能的互動式聊天機器人。它透過即時同步 AI 生成的文字與語音、唇同步、面部表情及身體動畫,彌補大型語言模型(LLMs)與 3D 角色之間的差距。

工作原理

此 SDK 將多個 AI 元件整合至 Unity 工作流程中:

  • LLM 集成:連接至 ChatGPT、Claude、Gemini 和 Dify 等服務,產生對話回應。支援函數呼叫與多模態功能。
  • 語音流程:使用語音轉文字(STT)進行聆聽(例如 OpenAI、Azure、Google),並使用文字轉語音(TTS)進行發言(例如 VOICEVOX、Style-Bert-VITS2)。包含語音活動偵測(VAD),以處理對話輪替與抗噪。
  • 角色控制ModelController 管理 3D 模型的狀態,根據 LLM 回應中嵌入的標籤(例如 [face:Joy])觸發面部表情與動畫。
  • 同步機制:將音訊輸出與唇同步及自主眨眼同步,創造出逼真的存在感。

適用對象

  • Unity 開發者:希望建構虛擬代理、AI Vtuber 或互動式 NPC 的人。
  • 應用開發者:開發 VR、AR 或 WebGL 應用,需要對話式 3D 界面的人。
  • AI 研究人員/愛好者:希望將 LLM 以視覺化、富有情感的 3D 角色形式呈現的人。

核心亮點

  • 多平台支援:相容 Windows、Mac、Linux、iOS、Android、VR、AR 與 WebGL。
  • 自然互動:支援「中斷」(在 AI 說話過程中插入)與 WebSocket 流式 STT,以降低延遲。
  • 情感控制:根據對話上下文,自主切換語音風格、面部表情與手勢。
  • 記憶與狀態:支援對話歷史的長期記憶與動態多語言切換。
  • 代理能力:與 Dify 和 AIAvatarKit 集成,使角色具備工具呼叫能力的 AI 代理。

相關

  • 專案
  • 專案
  • 專案
  • 專案