modal-labs/quillman
A voice chat app
What it solves
QuiLLMan 是一個語音聊天應用程式,可實現近乎即時、類人的語音互動。它透過使用雙向串流和高效的音訊壓縮,解決了通常與語音 AI 相關的延遲問題。
How it works
該應用程式使用語音對語音語言模型 (Moshi) 和串流編碼器/解碼器 (Mimi) 來持續進行聆聽、規劃和回應。它採用雙向 websocket 串流架構和 Opus 音訊編碼器來壓縮網路上的音訊數據,以確保低延遲回應。
Who it’s for
尋找建立基於語言模型的語音應用程式之起點或實驗場的開發者。
Highlights
- Speech-to-Speech: 使用 Moshi 模型進行持續聆聽和回應。
- Low Latency: 透過雙向 websockets 和 Opus 壓縮實現近乎即時的回應時間。
- Full Stack: 包含 React 前端和託管在 Modal 上的 FastAPI 後端。
- Serverless Deployment: 專為易於部署到 Modal 而設計,允許應用程式在不使用時縮減至零。
相關
- 專案
- 專案
- 專案
- 專案
- 專案