tensorforger/FluxRT

Real-time stream editing pipeline powered by the FLUX.2-klein-4B model, optimized for consumer GPUs

What it solves

FluxRT는 저지연으로 웹캠 또는 비디오 피드를 변환하도록 설계된 실시간 스트림 편집 파이프라인입니다. 대화형 프롬프트 업데이트와 참조 이미지 컨디셔닝을 지원하여 AI VTubing, 가상 피팅, 크리에이티브 코딩에 적합하며, 소비자용 GPU에 최적화되어 있습니다.

How it works

FluxRT는 FLUX.2-Klein instruct image editing model을 사용하며, 실시간 성능을 달성하기 위해 다음과 같은 최적화를 적용합니다:

  • Spatial KV Cache: 이전 프레임의 중간 계산을 재사용하는 커스텀 캐시 변형입니다. 비디오 프레임은 시간적으로 일관성이 있으므로, 프레임당 20-50%의 토큰만 재계산하여 GPU 사용량과 지연 시간을 줄입니다.
  • Real-Time Frame Interpolation: RIFE model을 통합하여 중간 프레임을 생성함으로써, 핵심 모델의 지연 시간 없이 부드러운 움직임을 보장합니다.
  • Multiprocessing & Shared Memory: 계산, I/O, 렌더링을 별도의 프로세스(Main, Inference, Output Scheduler)로 분리하고 공유 메모리를 사용하여 거의 제로 카피 프레임 전송을を実現합니다.
  • Model Compilation: TorchInductor를 사용하여 런타임 성능을 최대화합니다.

Who it’s for

콘텐츠 크리에이터, AI VTuber, 그리고 실시간 AI 이미지 변환 및 대화형 시각 예술에 관심 있는 개발자.

Highlights

  • High Performance: RTX 4090/5090 GPU에서 15-40 FPS를 달성하며, 엔드투엔드 지연 시간은 약 0.2-0.3초입니다.
  • Virtual Webcam Support: 가상 웹캠을 생성할 수 있는 GUI를 포함하여, 출력을 OBS, Zoom, Chrome과 같은 앱으로 스트리밍할 수 있습니다.
  • Reference Image Conditioning: FLUX.2 reference image 기능을 기본적으로 지원하여 실시간 AI 피팅룸과 같은 작업을 수행할 수 있습니다.
  • Extensibility: TAEF2를 통한 빠른 디코딩, Flow Upscaler를 통한 초해상도, int8 quantization을 통한 낮은 VRAM 사용량, LivePortrait를 통한 실시간 립 트랜스퍼를 위한 선택적 확장을 지원합니다."} ]}```json}{