modal-labs/quillman

A voice chat app

What it solves

QuiLLMan 是一個語音聊天應用程式,可實現近乎即時、類人的語音互動。它透過使用雙向串流和高效的音訊壓縮,解決了通常與語音 AI 相關的延遲問題。

How it works

該應用程式使用語音對語音語言模型 (Moshi) 和串流編碼器/解碼器 (Mimi) 來持續進行聆聽、規劃和回應。它採用雙向 websocket 串流架構和 Opus 音訊編碼器來壓縮網路上的音訊數據,以確保低延遲回應。

Who it’s for

尋找建立基於語言模型的語音應用程式之起點或實驗場的開發者。

Highlights

  • Speech-to-Speech: 使用 Moshi 模型進行持續聆聽和回應。
  • Low Latency: 透過雙向 websockets 和 Opus 壓縮實現近乎即時的回應時間。
  • Full Stack: 包含 React 前端和託管在 Modal 上的 FastAPI 後端。
  • Serverless Deployment: 專為易於部署到 Modal 而設計,允許應用程式在不使用時縮減至零。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案