xszyou/Fay

fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的agent框架。

解決的問題

Fay 提供了一個在行動應用程式、網站、大螢幕及單晶片微控制器等各種終端部署數位人(虛擬化身)的綜合框架。透過將語音辨識、語言處理及化身動畫整合到單一流水線中,它彌合了高階 AI 模型與最終使用者介面之間的鴻溝。

工作原理

該框架作為一個編排層,連接了多個模組化組件:

  • Input/Output:整合用於聽取的 ASR(自動語音辨識)與用於說話的 TTS(文字轉語音)。
  • Intelligence:透過與 OpenAI 相容的介面連接到 LLM,包括支援 DeepSeek 等「思考型」模型,以處理對話與決策。
  • Avatar Control:與數位人模型對接,驅動視覺動畫與表情。
  • Agent Capabilities:使用基於代理的系統進行自主工具呼叫與 MCP (Model Context Protocol) 工具管理。
  • Memory & Knowledge:支援自定義知識庫、問答對與仿生記憶,以提高自我意識與一致性。

適用對象

希望在自己的硬體或軟體產品中實現虛擬教師、虛擬主播、新聞播報員或互動式 AI 助手的開發者與企業。

亮點

  • 全棧整合:支援從語音輸入到數位人動畫的整個流水線。
  • 靈活部署:支援伺服器模式與獨立模式,並支援完全離線使用。
  • 多終端支援:專為輕鬆整合至應用程式、網站及嵌入式系統而設計。
  • 進階代理功能:包括支援自主工具呼叫、仿生記憶以及喚醒詞/中斷處理。
  • 並行處理:支援多個使用者與多個並行串流。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案