tong-io/tongflow

TongFlow : An Open-Source Multi-Modal GenAI Workflow Studio

解決する課題

TongFlowは、複数のモダリティにわたる複雑な生成AIワークフローをオーケストレーションするための、視覚的でハードルの低い方法を提供します。ユーザーは、異なるAI機能を単に追加、変換、結合するだけで、リップシンク動画、ミュージックビデオ、3Dモデルなどの高度なコンテンツを作成できるため、手動でのノード接続や複雑なパラメータ調整の必要がなくなります。

仕組み

このプラットフォームは、すべてのAIモデルをモダリティ変換(例:text-to-imageやtext-to-audio)として扱うコアコンセプトに基づいて動作します。ユーザーは、主に3つの操作を使用してキャンバスを操作します:

  • Add: テキスト、画像、オーディオ、ビデオ、ドキュメント、3Dモデル、またはURLをインポートします。
  • Transform: 画像生成、ビデオアップスケーリング、音声合成、音楽再構成などの特定のAI機能を使用します。
  • Combine: リップシンク、キャラクターの入れ替え、オーディオとビデオトラックの結合など、出力を融合させます。

システムはプラグインベースのアーキテクチャを採用しており、機能は独立したプラグインとしてパッケージ化されます。これらはクラウドAPI(OpenAIやGeminiなど)経由、またはローカル/クラウドGPUコンピューティング(Modal経由)で実行できます。

対象者

  • コンテンツクリエイター: ミュージックビデオやデジタルヒューマンの生成など、複雑なクリエイティブタスクの自動化を目指すユーザー。
  • AI開発者: カスタムのモダリティ変換プラグインを構築・デプロイしたい開発者。
  • プロトタイパー: マルチモーダルAIワークフローを実験するための、軽量なデスクトップまたはクラウドベースのスタジオを必要とする個人。

ハイライト

  • マルチモーダル対応: テキスト、画像、ビデオ、オーディオ、3Dモデル、ドキュメントを処理。
  • 拡張可能なプラグインシステム: あらゆるプラットフォームが独立した機能ノードをパッケージ化して公開可能。
  • 柔軟なデプロイ: クラウドスタジオ、軽量デスクトップアプリ、またはセルフホスト用のDockerとして利用可能。
  • 多様な機能: モーションキャプチャ、音楽のステム分離、ビデオのウォーターマーク除去などの高度な機能を含む。