tong-io/tongflow

TongFlow : An Open-Source Multi-Modal GenAI Workflow Studio

해결하는 문제

TongFlow는 여러 모달리티에 걸친 복잡한 생성형 AI 워크플로우를 오케스트레이션할 수 있는 시각적이고 진입 장벽이 낮은 방법을 제공합니다. 사용자가 다양한 AI 기능을 단순히 추가, 변환 및 결합하여 립싱크 비디오, 뮤직 비디오 또는 3D 모델과 같은 고급 콘텐츠를 생성할 수 있게 함으로써 수동 노드 연결이나 복잡한 매개변수 조정의 필요성을 제거합니다.

작동 방식

이 플랫폼은 모든 AI 모델을 모달리티 변환(예: text-to-image 또는 text-to-audio)으로 취급하는 핵심 개념을 기반으로 작동합니다. 사용자는 세 가지 주요 작업을 사용하여 캔버스와 상호 작용합니다:

  • Add: 텍스트, 이미지, 오디오, 비디오, 문서, 3D 모델 또는 URL을 가져옵니다.
  • Transform: 이미지 생성, 비디오 업스케일링, 음성 합성 또는 음악 재구성과 같은 특정 AI 기능을 적용합니다.
  • Combine: 립싱크 수행, 캐릭터 교체 또는 오디오 및 비디오 트랙 병합과 같이 출력을 융합합니다.

시스템은 기능이 독립적인 플러그인으로 패키지화되는 플러그인 기반 아키텍처를 사용합니다. 이는 클라우드 API(OpenAI 또는 Gemini와 같은)를 통해 실행하거나 로컬/클라우드 GPU 컴퓨팅(Modal을 통해)에서 실행할 수 있습니다.

대상 사용자

  • 콘텐츠 크리에이터: 뮤직 비디오 또는 디지털 휴먼 생성과 같은 복잡한 창의적 작업을 자동화하려는 사용자.
  • AI 개발자: 커스텀 모달리티 변환 플러그인을 구축하고 배포하려는 개발자.
  • 프로토타이퍼: 멀티모달 AI 워크플로우를 실험하기 위한 가벼운 데스크톱 또는 클라우드 기반 스튜디오가 필요한 개인.

주요 특징

  • 멀티모달 지원: 텍스트, 이미지, 비디오, 오디오, 3D 모델 및 문서를 처리합니다.
  • 확장 가능한 플러그인 시스템: 모든 플랫폼이 독립적인 기능 노드를 패키지화하고 게시할 수 있습니다.
  • 유연한 배포: 클라우드 스튜디오, 경량 데스크톱 앱 또는 셀프 호스팅을 위한 Docker로 사용할 수 있습니다.
  • 다양한 기능: 모션 캡처, 음악 스템 분리, 비디오 워터마크 제거와 같은 고급 기능을 포함합니다.