heshengtao/comfyui_LLM_party

LLM Agent Framework in ComfyUI includes MCP sever, Omost,GPT-sovits, ChatTTS,GOT-OCR2.0, and FLUX prompt nodes,access to Feishu,discord,and adapts to all llms with similar openai / aisuite interfaces, such as o1,ollama, gemini, grok, qwen, GLM, deepseek, kimi,doubao. Adapted to local llms, vlm, gguf such as llama-3.3 Janus-Pro, Linkage graphRAG

What it solves

ComfyUI LLM Party 提供了一套完整的節點,用於在 ComfyUI 生態系統中構建 LLM 工作流程。它彌合了大型語言模型與圖像生成工作流程之間的鴻溝,使用戶能夠直接在視覺化的節點環境中整合 AI 助手、RAG 系統以及複雜的代理行為。

How it works

此專案實作了多種自訂節點,支援多種模型載入方式:

  • API-based: 支援 OpenAI 相容的 API、Azure OpenAI、Grok 以及透過 oneapiaisuite 的其他多種服務。
  • Local Loading: 支援直接從 transformer library 載入模型、透過 llama-cpp-python 的 GGUF 格式,以及使用 Ollama 進行本地部署。
  • VLM Integration: 包含對 Vision‑Language Models(VLM)如 Llama-3.2-Vision 與 Qwen2.5-VL 的支援,用於圖像轉文字任務。

它能夠構建從簡單的 Stable Diffusion 提示生成,到複雜的代理‑代理互動模式(徑向與環形),以及與 Discord、飛書等社交應用的整合。

Who it’s for

  • ComfyUI 使用者 想將 LLM 整合到圖像生成管線。
  • AI 研究者與學生 需要視覺化介面來除錯參數與模型調整。
  • 串流媒體工作者 需要一站式的 LLM + TTS + ComfyUI 工作流程。
  • 開發者 使用 RAG 與 GraphRAG 建構本地化產業知識庫。

Highlights

  • Broad Model Support: 相容於大量 API 與本地模型,包括 GGUF 與基於 transformer 的 LLM/VLM。
  • Agentic Workflows: 支援多工具呼叫、角色設定與複雜的代理互動模式。
  • Advanced RAG: 實作產業特定的詞向量 RAG 與 GraphRAG 以管理知識庫。
  • MCP Tooling: 與 Model Context Protocol(MCP)整合,可連接外部 MCP 伺服器以擴充工具功能。
  • Streaming Output: API 呼叫時於終端即時顯示文字。