gokayfem/ComfyUI_VLM_nodes

ComfyUI nodes for vision-language models: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus open-vocabulary detection, SAM2/SAM3 segmentation, video temporal reasoning, GGUF via llama.cpp, and hosted LLM/VLM APIs.

何を解決するか

このプロジェクトは、ビジョン・ランゲージ・モデル(VLM)の統合、構造化されたビジョンタスク、および高度なテキスト処理を目的とした、ComfyUI向けの包括的なノードセットを提供します。RawなVLM出力と実用可能なデータの間のギャップを埋めるために、構造化された検出、セグメンテーション、トラッキング、および適応型ビデオ分析のツールを提供し、VRAMおよび推論速度の最適化を実現しています。

仕組み

このツールキットは、VLMパイプライン全体を処理する専用ノードのシリーズを実装しています:

  • モデル統合:ネイティブのTransformers実装を使用して、幅広いモデル(例:Qwen、SmolVLM2、Gemma 3)をサポートするカスタマイズされた「Modern VLM」インターフェース。
  • ビジョンパイプラインVLM_DETECTIONSVLM_TRACKS などのソケットを通じた構造化されたデータフローにより、モデル固有のフォーマットに依存せずに空間データをノード間で渡します。
  • 適応型ビデオインテリジェンス:高コストなフレームごとの推論を回避するため、動きやシーン変化に基づいた適応型フレームサンプリングと、動画コンテンツを要約する時間的推論器を採用しています。
  • VRAM最適化:画像ピクセル予算の縮小やモデルの常駐/オフロード管理を可能にするパフォーマンスユーティリティを含み、メモリオーバーフローを防ぎます。
  • テキストツールキット:VLMの応答からJSONをクリーニング、分割、結合、パースして、使用可能な文字列に変換するためのユーティリティノードのセット。

対象ユーザー

  • ComfyUIユーザー:生成ワークフローに高度な画像および動画理解を統合したい方。
  • AI開発者:下流タスク用に構造化されたビジョン出力(バウンディングボックス、マスク、ポリゴン)が必要な方。
  • ロボティクス/動画アナリスト:自動化された動画推論またはトラッキングパイプラインを開発している方。

主な特徴

  • 広範なモデル対応:Qwen、SmolVLM2、InternVL、Gemma 3、Florence-2、Moondreamなど、専用モデルも含む統合サポート。
  • ライブストリーミング:ComfyUIのWebSocketチャネルを通じて、リアルタイムでデコードされたテキストストリームを提供。
  • 構造化された空間データ:検出、トラック、イベントの標準化されたスキーマにより、VLM出力をマスクやクロップに簡単に変換可能。
  • 効率的な動画処理:適応型サンプリングとピクセル予算管理により、推論前の分析負荷を大幅に削減可能。
  • 高度なセグメンテーション:SAM2.1との統合およびComfyUIコアのSAM3.1用アダプタにより、高品質なオブジェクトトラッキングとマスク処理を実現。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト