datascale-ai/opentalking

OpenTalking: An industrial-grade open-source AI digital human framework that supports real-time conversation, private deployment, and pluggable models.

何を解決するか

OpenTalking は、リアルタイムのデジタル人間の会話を作成するための包括的でオープンソースのオーケストレーションフレームワークを提供します。音声認識(STT)、大規模言語モデル(LLM)、音声合成(TTS)、ビデオレンダリングを個別に手動で組み合わせる複雑さを解消し、インタラクティブな会話するアバターの作成を可能にします。

動作方法

このプロジェクトは、フロントエンドのインタラクション、セッション状態、LLMの応答、音声選択、中断制御、WebRTCによるオーディオ/ビデオ再生を含む、会話パイプライン全体を管理するプロダクションスタックとして機能します。軽量な「モック」モード(API検証用)から、OmniRTを用いた高品質なリモート推論まで、複数のデプロイパスをサポートしています。QuickTalk、Wav2Lip、FlashTalkなどのさまざまなデジタル人間ドライバーモデルを統合し、音声またはテキスト入力に基づいてアバターをアニメーション化します。

対象ユーザー

医療ガイド、ライブコマース、バーチャルコンパニオン、ニュースキャスターなどのシナリオでデジタル人間製品を開発している開発者やクリエイター、また音声駆動型ビデオ作成やビデオクラーニングを実験したい人向けに設計されています。

主な特徴

  • プラグイン可能なバックエンド:OpenAI互換インターフェースを含む、幅広いLLM、STT、TTSプロバイダーをサポート。
  • 柔軟なデプロイ:CPU専用の試用、コンシューマーGPU(RTX 3090/4090)のローカルセットアップ、高品質なリモートGPU/NPUクラスタへのパスを提供。
  • 包括的なツールセット:アバター、音声、モデル設定を管理するWebUIを備え、知識ベースとキャラクター記憶のサポートも提供。
  • 多様なレンダリングモデル:高速性を重視するQuickTalk、アクセシビリティに優れたWav2Lip、ビデオクラーニングおよび高品質な作成に適したFasterLivePortraitを統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト