xszyou/Fay

fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的agent框架。

解决的问题

Fay 提供了一个在移动应用、网站、大屏幕和单芯片微控制器等各种终端部署数字人(虚拟化身)的综合框架。通过将语音识别、语言处理和化身动画集成到单个流水线中,它弥合了高级 AI 模型与最终用户界面之间的鸿沟。

工作原理

该框架作为一个编排层,连接了多个模块化组件:

  • Input/Output:集成用于听取的 ASR(自动语音识别)和用于说话的 TTS(文本转语音)。
  • Intelligence:通过与 OpenAI 兼容的接口连接到 LLM,包括支持 DeepSeek 等“思考型”模型,以处理对话和决策。
  • Avatar Control:与数字人模型对接,驱动视觉动画和表情。
  • Agent Capabilities:使用基于智能体的系统进行自主工具调用和 MCP (Model Context Protocol) 工具管理。
  • Memory & Knowledge:支持自定义知识库、问答对和仿生记忆,以提高自我意识和一致性。

适用对象

希望在自己的硬件或软件产品中实现虚拟教师、虚拟主播、新闻播报员或交互式 AI 助手的开发者和企业。

亮点

  • 全栈集成:支持从语音输入到数字人动画的整个流水线。
  • 灵活部署:支持服务器模式和独立模式,并支持完全离线使用。
  • 多终端支持:专为轻松集成到应用、网站和嵌入式系统而设计。
  • 高级智能体功能:包括支持自主工具调用、仿生记忆以及唤醒词/中断处理。
  • 并发处理:支持多用户和多并发流。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目