gokayfem/ComfyUI_VLM_nodes

ComfyUI nodes for vision-language models: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus open-vocabulary detection, SAM2/SAM3 segmentation, video temporal reasoning, GGUF via llama.cpp, and hosted LLM/VLM APIs.

解決的問題

本專案為 ComfyUI 提供一組全面的生產導向節點,用於整合視覺-語言模型(VLM)、結構化視覺任務與進階文字處理。它透過提供結構化檢測、分割、追蹤與自適應影片分析工具,彌補原始 VLM 輸出與可用資料之間的差距,同時優化 VRAM 與推論速度。

如何運作

該工具包實作一系列專用節點,處理整個 VLM 流程:

  • 模型整合:採用精心挑選的「現代 VLM」介面,使用原生 Transformers 實作支援多種模型(例如 Qwen、SmolVLM2、Gemma 3)。
  • 視覺流程:透過 VLM_DETECTIONSVLM_TRACKS 等插座實作結構化資料流,無需依賴模型特定格式即可在節點間傳遞空間資料。
  • 自適應影片智慧:為避免昂貴的逐幀推論,採用基於運動與場景變化的自適應幀取樣,並使用時間推理器總結影片內容。
  • VRAM 優化:內建效能工具,可縮小影像像素預算並管理模型駐留/卸載,防止記憶體溢出。
  • 文字工具包:一組實用節點,用於清理、拆分、合併與解析 VLM 回應中的 JSON,轉換為可用字串。

適用對象

  • ComfyUI 使用者:希望在其生成工作流程中整合高階影像與影片理解功能的使用者。
  • AI 開發者:需要結構化視覺輸出(邊界框、遮罩、多邊形)用於後續任務的使用者。
  • 機器人/影片分析師:開發自動化影片推理或追蹤流程的開發者。

主要亮點

  • 廣泛模型支援:整合支援 Qwen、SmolVLM2、InternVL、Gemma 3,以及 Florence-2 和 Moondream 等專用模型。
  • 即時串流:透過 ComfyUI 的 WebSocket 通道即時解碼並傳輸文字串流。
  • 結構化空間資料:檢測、追蹤與事件的標準化架構,方便將 VLM 輸出轉換為遮罩或裁切圖像。
  • 高效影片處理:自適應取樣與像素預算管理,可大幅減少推論前的分析負載。
  • 高階分割:整合 SAM2.1 並提供 ComfyUI 核心 SAM3.1 的適配器,實現高品質物件追蹤與遮罩。

相關

  • 專案
  • 專案
  • Dispatch
  • Dispatch
  • 專案