modal-labs/quillman

A voice chat app

What it solves

QuiLLMan は、人間のような即時的な音声インタラクションを可能にする音声チャットアプリケーションです。双方向ストリーミングと効率的なオーディオ圧縮技術を用いることで、、従来の音声 AI の遅延問題を音声 AI の遅延問題 を解決します。

How it works

このアプリは、音声対音声言語モデル (Moshi) とストリーミングエンコーダー/デコーダー (Mimi) を使用して、継続的にリスニング、プランニング、およびレスポンスを行います。双方向 WebSocket ストリーミングアーキテクチャと Opus オーディオコーデックを使用してネットワーク上のオーディオデータを圧縮し、低遅延レスポンスを実現します。

Who it’s for

言語モデルベースの音声アプリケーションを構築するための、スターティングポイントやプレイグラウンドを探している開発者向けです。

Highlights

  • Speech-to-Speech: Moshi モデルを使用して、継続的なリスニングとレスポンスを行います。
  • Low Latency: 双方向 WebSocket と Opus 圧縮により、ほぼ即時的なレスポンスタイムを実現します。
  • Full Stack: React フロントエンドと Modal にホストされている FastAPI バックエンドを含みます。
  • Serverless Deployment: Modal への簡単なデプロイメントが受めに設計されており、使用されていない時はアプリケーションを scale to zero にすることが可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト