xszyou/Fay

fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的agent框架。

해결하는 문제

Fay는 모바일 앱, 웹사이트, 대형 스크린, 싱글 칩 마이크로컴퓨터와 같은 다양한 터미널에 디지털 휴먼(가상 아바타)을 배포하기 위한 포괄적인 프레임워크를 제공합니다. 음성 인식, 언어 처리 및 아바타 애니메이션을 단일 파이프라인으로 통합하여 고수준 AI 모델과 엔드 유저 인터페이스 사이의 간극을 메웁니다.

작동 방식

이 프레임워크는 여러 모듈형 구성 요소를 연결하는 오케스트레이션 레이어 역할을 합니다:

  • Input/Output: 듣기를 위한 ASR(자동 음성 인식)과 말하기를 위한 TTS(Text-to-Speech)를 통합합니다.
  • Intelligence: OpenAI 호환 인터페이스를 통해 LLM에 연결되며, DeepSeek와 같은 "사고형" 모델을 지원하여 대화 및 의사 결정을 처리합니다.
  • Avatar Control: 디지털 휴먼 모델과 인터페이스하여 시각적 애니메이션과 표정을 구동합니다.
  • Agent Capabilities: 자율적인 도구 호출 및 MCP (Model Context Protocol) 도구 관리를 위해 에이전트 기반 시스템을 사용합니다.
  • Memory & Knowledge: 사용자 정의 지식 베이스, Q&A 쌍 및 바이오닉 메모리를 지원하여 자기 인식과 일관성을 향상시킵니다.

대상

가상 교사, 가상 앵커, 뉴스 진행자 또는 대화형 AI 어시스턴트를 자체 하드웨어 또는 소프트웨어 제품에 구현하고자 하는 개발자 및 기업.

주요 특징

  • 풀스택 통합: 음성 입력부터 디지털 휴먼 애니메이션까지의 전체 파이프라인을 지원합니다.
  • 유연한 배포: 서버 및 스탠드얼론 모드 모두에서 작동하며 완전한 오프라인 사용을 지원합니다.
  • 멀티 터미널 지원: 앱, 웹사이트 및 임베디드 시스템에 쉽게 통합되도록 설계되었습니다.
  • 고급 에이전트 기능: 자율적인 도구 호출, 바이오닉 메모리, 웨이크 워드/인터럽트 처리를 포함합니다.
  • 동시 처리: 여러 사용자 및 여러 동시 스트림을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트