modal-labs/quillman

A voice chat app

What it solves

QuiLLMan 是一个语音聊天应用,可以实现近乎即时的、类人的语音交互。它通过使用双向流和高效的音频压缩,解决了通常与语音 AI 相关的延迟问题。

How it works

该应用使用语音对语音语言模型 (Moshi) 和流式编码器/解码器 (Mimi) 来持续进行聆听、规划和响应。它采用双向 websocket 流式架构和 Opus 音频编解码器来压缩网络上的音频数据,以确保低延迟响应。

Who it’s for

寻找构建基于语言模型的语音应用的起点或游乐场开发的开发者。

Highlights

  • Speech-to-Speech: 使用 Moshi 模型进行持续聆听和响应。

  • Low Latency: 通过双向 websockets 和 Opus 压缩实现近乎即时的响应时间。

  • Full Stack: 包含 React 前端和托管在 Modal 上的 FastAPI 后端。

  • Serverless Deployment: 设计用于轻松部署到 Modal,允许应用在不使用时缩减至零。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目