worm128/AI-YinMei

AI吟美-人工智能主播-Vtuber-桌宠-智能体

解决的问题

AI-YinMei 提供一个一体化平台,用于创建由 AI 驱动的直播虚拟形象和机器人。它解决了将多种 AI 模态(如 LLM、文本转语音 TTS、视觉、角色动画)整合到单一系统中的复杂性,使该系统能够实时与 Bilibili、TikTok、QQ 等多个平台的观众进行互动。

工作原理

该系统作为中央枢纽,聚合输入(如直播评论或聊天消息),并通过 AI 模型流水线进行处理。它使用多头注意力机制进行意图与情感分析,连接 OpenAI 兼容的 LLM 实现对话,采用流式 TTS(如 CosyVoice2 或 GPT-SoVITS)实现低延迟语音响应。系统与 VTube Studio 或其自研桌面宠物软件集成以实现视觉呈现,并使用 Neo4j 实现“扩散式思考”(知识图谱关系),使用 FastGPT 实现基于 RAG 的知识管理。

适用人群

专为希望部署一个可自主唱歌、绘画、与观众互动的动漫风格 AI 人设(VTuber)的主播、内容创作者和爱好者设计。

核心亮点

  • 多平台集成:聚合 Bilibili、TikTok、快手、斗鱼、虎牙、微信、QQ 等平台的评论。
  • 低延迟:支持全流式对话与 TTS,响应时间低至 600ms。
  • 丰富工具集:内置 27 个工具,涵盖网页搜索(通过 SearXNG)、图像生成(Stable Diffusion)、计算机控制等任务。
  • 高级记忆机制:结合短期 MongoDB 持久化与长期记忆,基于时间相关关键词选择性唤醒。
  • 多模态能力:支持 AI 唱歌(语音克隆)、图像生成、基于视觉的摄像头监控。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目