xszyou/Fay
fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的agent框架。
解决的问题
Fay 提供了一个在移动应用、网站、大屏幕和单芯片微控制器等各种终端部署数字人(虚拟化身)的综合框架。通过将语音识别、语言处理和化身动画集成到单个流水线中,它弥合了高级 AI 模型与最终用户界面之间的鸿沟。
工作原理
该框架作为一个编排层,连接了多个模块化组件:
- Input/Output:集成用于听取的 ASR(自动语音识别)和用于说话的 TTS(文本转语音)。
- Intelligence:通过与 OpenAI 兼容的接口连接到 LLM,包括支持 DeepSeek 等“思考型”模型,以处理对话和决策。
- Avatar Control:与数字人模型对接,驱动视觉动画和表情。
- Agent Capabilities:使用基于智能体的系统进行自主工具调用和 MCP (Model Context Protocol) 工具管理。
- Memory & Knowledge:支持自定义知识库、问答对和仿生记忆,以提高自我意识和一致性。
适用对象
希望在自己的硬件或软件产品中实现虚拟教师、虚拟主播、新闻播报员或交互式 AI 助手的开发者和企业。
亮点
- 全栈集成:支持从语音输入到数字人动画的整个流水线。
- 灵活部署:支持服务器模式和独立模式,并支持完全离线使用。
- 多终端支持:专为轻松集成到应用、网站和嵌入式系统而设计。
- 高级智能体功能:包括支持自主工具调用、仿生记忆以及唤醒词/中断处理。
- 并发处理:支持多用户和多并发流。
相关
- 项目
- 项目
- 项目
- 项目
- 项目