xszyou/Fay
fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的agent框架。
解決的問題
Fay 提供了一個在行動應用程式、網站、大螢幕及單晶片微控制器等各種終端部署數位人(虛擬化身)的綜合框架。透過將語音辨識、語言處理及化身動畫整合到單一流水線中,它彌合了高階 AI 模型與最終使用者介面之間的鴻溝。
工作原理
該框架作為一個編排層,連接了多個模組化組件:
- Input/Output:整合用於聽取的 ASR(自動語音辨識)與用於說話的 TTS(文字轉語音)。
- Intelligence:透過與 OpenAI 相容的介面連接到 LLM,包括支援 DeepSeek 等「思考型」模型,以處理對話與決策。
- Avatar Control:與數位人模型對接,驅動視覺動畫與表情。
- Agent Capabilities:使用基於代理的系統進行自主工具呼叫與 MCP (Model Context Protocol) 工具管理。
- Memory & Knowledge:支援自定義知識庫、問答對與仿生記憶,以提高自我意識與一致性。
適用對象
希望在自己的硬體或軟體產品中實現虛擬教師、虛擬主播、新聞播報員或互動式 AI 助手的開發者與企業。
亮點
- 全棧整合:支援從語音輸入到數位人動畫的整個流水線。
- 靈活部署:支援伺服器模式與獨立模式,並支援完全離線使用。
- 多終端支援:專為輕鬆整合至應用程式、網站及嵌入式系統而設計。
- 進階代理功能:包括支援自主工具呼叫、仿生記憶以及喚醒詞/中斷處理。
- 並行處理:支援多個使用者與多個並行串流。
相關
- 專案
- 專案
- 專案
- 專案
- 專案