uezo/ChatdollKit
ChatdollKit enables you to make your 3D model into a chatbot
解决的问题
ChatdollKit 是一个 3D 虚拟助手 SDK,允许开发者将 3D 模型(特别是 VRM 模型)转换为具备语音功能的交互式聊天机器人。它通过将 AI 生成的文本与语音、唇同步、面部表情和身体动画实时同步,弥合了大型语言模型(LLMs)与 3D 角色之间的差距。
工作原理
该 SDK 将多个 AI 组件集成到 Unity 工作流中:
- LLM 集成:连接到 ChatGPT、Claude、Gemini 和 Dify 等服务,生成对话响应。支持函数调用和多模态功能。
- 语音流水线:使用语音转文本(STT)进行听(例如 OpenAI、Azure、Google),使用文本转语音(TTS)进行说(例如 VOICEVOX、Style-Bert-VITS2)。包含语音活动检测(VAD),以处理对话轮换和抗噪。
- 角色控制:
ModelController管理 3D 模型的状态,根据 LLM 响应中嵌入的标签(例如[face:Joy])触发面部表情和动画。 - 同步机制:将音频输出与唇同步和自主眨眼同步,营造出逼真的存在感。
适用人群
- Unity 开发者:希望构建虚拟代理、AI Vtuber 或交互式 NPC 的人。
- 应用开发者:开发 VR、AR 或 WebGL 应用,需要对话式 3D 界面的人。
- AI 研究人员/爱好者:希望将 LLM 以视觉化、富有情感的 3D 角色形式呈现的人。
核心亮点
- 多平台支持:兼容 Windows、Mac、Linux、iOS、Android、VR、AR 和 WebGL。
- 自然交互:支持“打断”(在 AI 说话过程中插入)和 WebSocket 流式 STT,以降低延迟。
- 情感控制:根据对话上下文,自主切换语音风格、面部表情和手势。
- 记忆与状态:支持对话历史的长期记忆和动态多语言切换。
- 代理能力:与 Dify 和 AIAvatarKit 集成,使角色具备工具调用能力的 AI 代理。
相关
- 项目
- 项目
- 项目
- 项目