gokayfem/ComfyUI_VLM_nodes

ComfyUI nodes for vision-language models: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus open-vocabulary detection, SAM2/SAM3 segmentation, video temporal reasoning, GGUF via llama.cpp, and hosted LLM/VLM APIs.

解决的问题

本项目为 ComfyUI 提供了一套全面的生产级节点,用于集成视觉语言模型(VLM)、结构化视觉任务和高级文本处理。它通过提供结构化检测、分割、跟踪和自适应视频分析工具,弥合了原始 VLM 输出与可用数据之间的差距,同时优化了 VRAM 和推理速度。

如何工作

该工具包实现了一系列专用节点,处理整个 VLM 流水线:

  • 模型集成:采用精选的「现代 VLM」接口,使用原生 Transformers 实现支持多种模型(例如 Qwen、SmolVLM2、Gemma 3)。
  • 视觉流水线:通过 VLM_DETECTIONSVLM_TRACKS 等套接字实现结构化数据流,无需依赖模型特定格式即可在节点间传递空间数据。
  • 自适应视频智能:为避免昂贵的逐帧推理,采用基于运动和场景变化的自适应帧采样,并使用时间推理器总结视频内容。
  • VRAM 优化:包含性能工具,可缩小图像像素预算并管理模型驻留/卸载,防止内存溢出。
  • 文本工具包:一组实用节点,用于清理、拆分、合并和解析 VLM 响应中的 JSON,转换为可用字符串。

适用人群

  • ComfyUI 用户:希望在其生成工作流中集成高级图像和视频理解功能的用户。
  • AI 开发者:需要结构化视觉输出(边界框、掩码、多边形)用于下游任务的用户。
  • 机器人/视频分析师:构建自动化视频推理或跟踪流水线的开发者。

主要亮点

  • 广泛模型支持:集成支持 Qwen、SmolVLM2、InternVL、Gemma 3,以及 Florence-2 和 Moondream 等专用模型。
  • 实时流式传输:通过 ComfyUI 的 WebSocket 通道实时解码并传输文本流。
  • 结构化空间数据:检测、跟踪和事件的标准化模式,便于将 VLM 输出转换为掩码或裁剪图像。
  • 高效视频处理:自适应采样和像素预算管理,可显著减少推理前的分析工作量。
  • 高级分割:集成 SAM2.1 并提供 ComfyUI 核心 SAM3.1 的适配器,实现高质量对象跟踪和掩码。

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • 项目