uezo/ChatdollKit

ChatdollKit enables you to make your 3D model into a chatbot

解决的问题

ChatdollKit 是一个 3D 虚拟助手 SDK,允许开发者将 3D 模型(特别是 VRM 模型)转换为具备语音功能的交互式聊天机器人。它通过将 AI 生成的文本与语音、唇同步、面部表情和身体动画实时同步,弥合了大型语言模型(LLMs)与 3D 角色之间的差距。

工作原理

该 SDK 将多个 AI 组件集成到 Unity 工作流中:

  • LLM 集成:连接到 ChatGPT、Claude、Gemini 和 Dify 等服务,生成对话响应。支持函数调用和多模态功能。
  • 语音流水线:使用语音转文本(STT)进行听(例如 OpenAI、Azure、Google),使用文本转语音(TTS)进行说(例如 VOICEVOX、Style-Bert-VITS2)。包含语音活动检测(VAD),以处理对话轮换和抗噪。
  • 角色控制ModelController 管理 3D 模型的状态,根据 LLM 响应中嵌入的标签(例如 [face:Joy])触发面部表情和动画。
  • 同步机制:将音频输出与唇同步和自主眨眼同步,营造出逼真的存在感。

适用人群

  • Unity 开发者:希望构建虚拟代理、AI Vtuber 或交互式 NPC 的人。
  • 应用开发者:开发 VR、AR 或 WebGL 应用,需要对话式 3D 界面的人。
  • AI 研究人员/爱好者:希望将 LLM 以视觉化、富有情感的 3D 角色形式呈现的人。

核心亮点

  • 多平台支持:兼容 Windows、Mac、Linux、iOS、Android、VR、AR 和 WebGL。
  • 自然交互:支持“打断”(在 AI 说话过程中插入)和 WebSocket 流式 STT,以降低延迟。
  • 情感控制:根据对话上下文,自主切换语音风格、面部表情和手势。
  • 记忆与状态:支持对话历史的长期记忆和动态多语言切换。
  • 代理能力:与 Dify 和 AIAvatarKit 集成,使角色具备工具调用能力的 AI 代理。

相关

  • 项目
  • 项目
  • 项目
  • 项目