tensorforger/FluxRT

Real-time stream editing pipeline powered by the FLUX.2-klein-4B model, optimized for consumer GPUs

What it solves

FluxRT 是一个即時串流編輯管線,旨在以低延遲轉換器械或影片串流。它支援互動式提示詞更新和參考圖條件化,使其適合用於 AI VTubing、虛擬試穿、以及創意編碼,同時針對消費級 GPU 進行了優化。

How it works

FluxRT 使用 FLUX.2-Klein instruct image editing model 並採用了幾種優化技術以實現即時性能:

  • Spatial KV Cache: 一種自定義的快取變體,可重用前一幀的中間計算結果。由於影片幀之間具有時間上的連續性,它每幀僅需重新計算 20-50% 的 token,從而降低了 GPU 利用率和延遲。
  • Real-Time Frame Interpolation: 集成了 RIFE model 藉藉以生成中間幀,確保在不增加核心模型延遲的情況下實現平滑的運動。
  • Multiprocessing & Shared Memory: 將計算、I/O 和渲染解耦為獨立的進程(Main, Inference, 和 Output Scheduler),並使用共享內存來實現近乎零拷貝的幀轉換。
  • Model Compilation: 使用 TorchInductor 以最大化運行時性能。

Who it’s for

內容創作者、AI VTubers、以及對即時 AI 圖像轉換和互動式視覺藝術感興趣的開發者。

Highlights

  • High Performance: 在 RTX 4090/5090 GPU 上實現了 15-40 FPS,端到端延遲約為 0.2-0.3 秒。

  • Virtual Webcam Support: 包含一個可以創建虛擬網路攝影機的 GUI,允許將輸出串流到 OBS, Zoom, 和 Chrome 等應用程式。

  • Reference Image Conditioning: 原生支援 FLUX.2 reference image 特性,可用於即時 AI 試衣間任務。

  • Extensibility: 支援可選的擴展功能,例如 TAEF2 用於更快的解碼、Flow Upscaler 用於超解析度、int8 quantization 用於降低 VRAM 使用量,以及 LivePortrait 用於即時唇部轉移。"},