modal-labs/quillman
A voice chat app
What it solves
QuiLLMan 是一个语音聊天应用,可以实现近乎即时的、类人的语音交互。它通过使用双向流和高效的音频压缩,解决了通常与语音 AI 相关的延迟问题。
How it works
该应用使用语音对语音语言模型 (Moshi) 和流式编码器/解码器 (Mimi) 来持续进行聆听、规划和响应。它采用双向 websocket 流式架构和 Opus 音频编解码器来压缩网络上的音频数据,以确保低延迟响应。
Who it’s for
寻找构建基于语言模型的语音应用的起点或游乐场开发的开发者。
Highlights
Speech-to-Speech: 使用 Moshi 模型进行持续聆听和响应。
Low Latency: 通过双向 websockets 和 Opus 压缩实现近乎即时的响应时间。
Full Stack: 包含 React 前端和托管在 Modal 上的 FastAPI 后端。
Serverless Deployment: 设计用于轻松部署到 Modal,允许应用在不使用时缩减至零。
相关
- 项目
- 项目
- 项目
- 项目
- 项目