tensorforger/FluxRT

Real-time stream editing pipeline powered by the FLUX.2-klein-4B model, optimized for consumer GPUs

What it solves

FluxRT 是一个实时流媒体编辑管线,旨在以低延迟转换摄像头或视频流。它支持交互式提示词更新和参考图条件化,使其适合用于 AI VTubing、虚拟试穿、以及创意编程,同时针对消费级 GPU 进行了优化。

How it works

FluxRT 使用 FLUX.2-Klein instruct image editing model 并采用了几种优化技术以实现实时性能:

  • Spatial KV Cache: 一种自定义的缓存变体,可以重用前一帧的中间计算结果。由于视频帧之间具有时间上的连续性,它每帧仅需重新计算 20-50% 的 token,从而降低了 GPU 利用率和延迟。
  • Real-Time Frame Interpolation: 集成了 RIFE model 以生成中间帧,确保在不增加核心模型延迟的情况下实现平滑的运动。
  • Multiprocessing & Shared Memory: 将计算、I/O 和渲染解耦为独立的进程(Main, Inference, 和 Output Scheduler),并使用共享内存来实现近乎零拷贝的帧传输。
  • Model Compilation: 使用 TorchInductor 以最大化运行时性能。

Who it’s for

内容创作者、AI VTubers、以及对实时 AI 图像转换和交互式视觉艺术感兴趣的开发者。

Highlights

  • High Performance: 在 RTX 4090/5090 GPU 上实现 15-40 FPS,端到端延迟约为 0.2-0.3 秒。

  • Virtual Webcam Support: 包含一个可以创建虚拟网络摄像头,允许将输出流媒体传输到 OBS, Zoom, 和 Chrome 等应用。

  • Reference Image Conditioning: 原生支持 FLUX.2 reference image 特性,可用于实时 AI 试衣间任务。

  • Extensibility: 支持可选的扩展功能,如 TAEF2 用于更快的解码、Flow Upscaler 用于超分辨率、int8 quantization 用于降低 VRAM 使用量,以及 LivePortrait 用于实时唇部转移。