gokayfem/ComfyUI_VLM_nodes

ComfyUI nodes for vision-language models: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus open-vocabulary detection, SAM2/SAM3 segmentation, video temporal reasoning, GGUF via llama.cpp, and hosted LLM/VLM APIs.

해결하는 문제

이 프로젝트는 비전-언어 모델(VLM), 구조화된 비전 작업, 고급 텍스트 처리를 위한 ComfyUI용 포괄적인 생산용 노드 세트를 제공합니다. 원시 VLM 출력과 실용 가능한 데이터 사이의 격차를 메우기 위해, 구조화된 탐지, 세그멘테이션, 추적, 적응형 비디오 분석 도구를 제공하며, VRAM과 추론 속도 최적화를 실현합니다.

작동 방식

이 툴킷은 VLM 파이프라인 전체를 처리하는 전용 노드 시리즈를 구현합니다:

  • 모델 통합: 네이티브 Transformers 구현을 사용하여 다양한 모델(예: Qwen, SmolVLM2, Gemma 3)을 지원하는 커리레이티드 "Modern VLM" 인터페이스.
  • 비전 파이프라인: 모델 고유의 형식에 의존하지 않고 공간 데이터를 노드 간에 전달하기 위해 VLM_DETECTIONSVLM_TRACKS와 같은 소켓을 사용하는 구조화된 데이터 흐름을 사용합니다.
  • 적응형 비디오 인텔리전스: 비용이 큰 프레임별 추론을 피하기 위해, 움직임과 장면 변화 기반의 적응형 프레임 샘플링과 비디오 콘텐츠를 요약하는 시간적 추론기를 사용합니다.
  • VRAM 최적화: 이미지 픽셀 예산 축소 및 모델 주거/오프로딩 관리를 가능하게 하는 성능 유틸리티를 포함하여 메모리 오버플로우를 방지합니다.
  • 텍스트 툴킷: VLM 응답에서 JSON을 정리, 분할, 결합, 파싱하여 사용 가능한 문자열로 변환하는 유틸리티 노드 세트.

대상 사용자

  • ComfyUI 사용자: 생성 워크플로우에 고급 이미지 및 비디오 이해 기능을 통합하고자 하는 사용자.
  • AI 개발자: 하류 작업용 구조화된 비전 출력(경계 상자, 마스크, 다각형)이 필요한 사용자.
  • 로보틱스/비디오 분석가: 자동화된 비디오 추론 또는 추적 파이프라인을 개발하는 개발자.

주요 특징

  • 광범위한 모델 지원: Qwen, SmolVLM2, InternVL, Gemma 3, 그리고 Florence-2 및 Moondream과 같은 전용 모델까지 통합 지원.
  • 라이브 스트리밍: ComfyUI의 WebSocket 채널을 통해 실시간으로 디코딩된 텍스트 스트림 제공.
  • 구조화된 공간 데이터: 탐지, 트랙, 이벤트에 대한 표준화된 스키마로 VLM 출력을 마스크나 자르기 쉽게 변환 가능.
  • 효율적인 비디오 처리: 적응형 샘플링과 픽셀 예산 관리로 추론 전 분석 부하를 크게 줄일 수 있음.
  • 고급 세그멘테이션: SAM2.1과의 통합 및 ComfyUI 코어 SAM3.1용 어댑터를 통해 고품질 객체 추적 및 마스킹을 구현.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트