worm128/AI-YinMei

AI吟美-人工智能主播-Vtuber-桌宠-智能体

해결하는 문제

AI-YinMei는 AI 기반 라이브 스트리밍 아바타와 봇을 생성하기 위한 통합 플랫폼을 제공합니다. LLM, 텍스트-to-음성(TTS), 비전, 캐릭터 애니메이션과 같은 다양한 AI 모달리티를 하나의 시스템에 통합하는 복잡성을 해결하며, Bilibili, TikTok, QQ 등 다양한 플랫폼에서 실시간으로 시청자와 상호작용할 수 있는 시스템을 구현합니다.

작동 방식

이 시스템은 라이브 스트림 댓글이나 채팅 메시지와 같은 입력을 집계하는 중앙 허브 역할을 합니다. AI 모델의 파이프라인을 통해 처리하며, 의도와 감정 분석에 다중 헤드 어텐션 메커니즘을 사용하고, OpenAI 호환 LLM과 연결하여 대화를 수행합니다. 저지연 음성 응답을 위해 CosyVoice2 또는 GPT-SoVITS와 같은 스트리밍 TTS를 활용합니다. 시각적 표현을 위해 VTube Studio 또는 자체 데스크톱 펫 소프트웨어와 통합하며, Neo4j를 사용해 "확산적 사고"(지식 그래프 관계)를 처리하고, FastGPT를 통해 RAG 기반 지식 관리를 수행합니다.

대상 사용자

자신만의 애니메이션 스타일 AI 캐릭터(VTuber)를 자율적으로 노래하고, 그림을 그리고 시청자와 대화할 수 있도록 배포하고 싶은 라이브 스트리머, 콘텐츠 크리에이터, 애호가를 위한 것입니다.

주요 기능

  • 다중 플랫폼 통합: Bilibili, TikTok, Kuaishou, Douyu, Huya, WeChat, QQ에서 댓글을 통합합니다.
  • 저지연: 완전한 스트리밍 대화 및 TTS를 지원하여 최소 600ms의 응답 시간을 달성합니다.
  • 풍부한 도구 세트: SearXNG를 통한 웹 검색, Stable Diffusion를 통한 이미지 생성, 컴퓨터 제어 등 총 27개의 내장 도구를 제공합니다.
  • 고도화된 기억 기능: 단기 메모리(MongoDB 지속성)와 장기 기억을 결합하며, 시간 관련 키워드에 따라 선택적으로 각성됩니다.
  • 다중 모달 기능: AI 노래(보이스 클로닝), 이미지 생성, 시각 기반 카메라 모니터링을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트