uezo/ChatdollKit
ChatdollKit enables you to make your 3D model into a chatbot
解決的問題
ChatdollKit 是一個 3D 虛擬助手 SDK,讓開發者能將 3D 模型(特別是 VRM 模型)轉換為具備語音功能的互動式聊天機器人。它透過即時同步 AI 生成的文字與語音、唇同步、面部表情及身體動畫,彌補大型語言模型(LLMs)與 3D 角色之間的差距。
工作原理
此 SDK 將多個 AI 元件整合至 Unity 工作流程中:
- LLM 集成:連接至 ChatGPT、Claude、Gemini 和 Dify 等服務,產生對話回應。支援函數呼叫與多模態功能。
- 語音流程:使用語音轉文字(STT)進行聆聽(例如 OpenAI、Azure、Google),並使用文字轉語音(TTS)進行發言(例如 VOICEVOX、Style-Bert-VITS2)。包含語音活動偵測(VAD),以處理對話輪替與抗噪。
- 角色控制:
ModelController管理 3D 模型的狀態,根據 LLM 回應中嵌入的標籤(例如[face:Joy])觸發面部表情與動畫。 - 同步機制:將音訊輸出與唇同步及自主眨眼同步,創造出逼真的存在感。
適用對象
- Unity 開發者:希望建構虛擬代理、AI Vtuber 或互動式 NPC 的人。
- 應用開發者:開發 VR、AR 或 WebGL 應用,需要對話式 3D 界面的人。
- AI 研究人員/愛好者:希望將 LLM 以視覺化、富有情感的 3D 角色形式呈現的人。
核心亮點
- 多平台支援:相容 Windows、Mac、Linux、iOS、Android、VR、AR 與 WebGL。
- 自然互動:支援「中斷」(在 AI 說話過程中插入)與 WebSocket 流式 STT,以降低延遲。
- 情感控制:根據對話上下文,自主切換語音風格、面部表情與手勢。
- 記憶與狀態:支援對話歷史的長期記憶與動態多語言切換。
- 代理能力:與 Dify 和 AIAvatarKit 集成,使角色具備工具呼叫能力的 AI 代理。
相關
- 專案
- 專案
- 專案
- 專案