chflame163/ComfyUI_LayerStyle_Advance

The nodes detached from [ComfyUI Layer Style](https://github.com/chflame163/ComfyUI_LayerStyle) are mainly those with complex requirements for dependency packages.

解决的问题

此项目提供了一组进阶的 ComfyUI 自定义节点,专门用于处理需要大量依赖包的复杂图像处理任务。它通过增加高质量图像标注、视觉语言模型 (VLM) 推理和进阶图像合成功能,扩展了 ComfyUI 的基本功能。

运作方式

它将各种专业 AI 模型和 API 整合到 ComfyUI 的节点式工作流程中。包括:

  • 本地 VLM 推理:实现如 Llama 3.2 Vision、JoyCaption2 和 SmolVLM 等模型,用于图像转文字任务。
  • API 整合:连接到如 DeepSeek、Gemini、ZhipuGLM4 和 Jimeng 等外部服务,进行文字与视觉推理。
  • 图像处理:提供用于建立图像拼贴的工具,并利用 SAM2 (Segment Anything Model 2) 进行精确的物体遮罩。
  • 专业处理:使用如 Florence-2 等模型进行物体识别与裁剪。

适用对象

  • 希望自动化从图像生成详细提示词 (image-to-prompt) 的 ComfyUI 用户。
  • 需要在节点式工作流程中使用进阶图层、遮罩和图像合成工具的数字艺术家与 AI 创作者。
  • 寻求将最先进的 VLM 和 LLM 整合到图像生成管线中的用户。

特色亮点

  • 进阶标注:包含 JoyCaption2,用于产生高度详细且可自定义的图像描述(例如指定光影、摄影角度或美学质量)。
  • 多模型支持:支持广泛的本地与基于 API 的模型,包括 Llama 3.2 Vision、Qwen 和 Gemini 2.0 Flash。
  • 智慧合成:拼贴节点 (Collage node) 可在建立图像网格时,使用 Florence-2 进行智慧物体识别与裁剪。
  • 高效资源管理:拆分模型加载节点(如 JoyCaption2Split),可在多个节点间共享模型,减少 VRAM 使用量。

相关

  • 项目
  • 项目
  • 项目
  • 项目