SerialLain3170/adeleine

一個支援透過彩色提示、文字標籤或參考影像進行引導的線稿自動上色深度學習框架。

Bing-su/adetailer

一個用於 Stable Diffusion web UI 的擴展,可自動完成遮罩與修復,以優化生成圖像的細節。

cocktailpeanut/fluxgym

Flux Gym 提供了一個 Gradio Web UI,讓您可以在 12-20GB GPU 上訓練 FLUX diffusion LoRAs。它封裝了 Kohya-ss 訓練腳本,提供完整的腳本選項、自動模型下載、可選的樣本圖像生成以及一鍵發佈到 Hugging Face。

deepgenteam/deepgen

DeepGen 1.0 是一個輕量級 5B 參數統一多模態模型,將圖像生成、編輯與推理整合至單一框架中。

nihui/zimage-ncnn-vulkan

一個基於 ncnn 的可攜式 Z-Image 生成器實作,可在任何支援 Vulkan 的 GPU 上實現高效能圖像生成、圖像修復與 ControlNet 支援。

Lornatang/SRGAN-PyTorch

基於生成對抗網路的 PyTorch 重實作 SRGAN,可生成恢復細緻紋理的 4 倍放大照片級真實感影像。

asagi4/comfyui-prompt-control

這是一個 ComfyUI 擴充功能,讓您能透過簡單的文字提示詞來控制複雜的 AI 圖像生成工作流(例如 LoRA 載入、提示詞排程與區域提示詞),而無需手動連接數十個節點。

yanokusnir-ai/one-node-flux-2-klein

一個 ComfyUI 自訂節點,將完整的 FLUX.2 [klein] 工作流程封裝為單一、自給自足的 UI 小工具,消除複雜的節點圖。

worldbench/DanceOPD

DanceOPD 是一個研究型函式庫,將多種基於擴散模型的圖像生成能力(文字轉圖像、局部編輯、全局編輯、寫實度等)濃縮到單一模型中。它將每個教師模型視為速度場,在學生模型的自身 Rollout 狀態下進行查詢,並使用簡單的速度 MSE 損失進行訓練。該儲存庫支援 SD-3.5-Medium 和 Z-Image 後端,包含一個微型煙霧測試(smoke-test),並提供用於 LoRA 適配器完整訓練的腳本與配置。

hustvl/ControlAR

ControlAR 為自回歸模型提供可控圖像生成,支援透過邊緣、深度或遮罩進行空間引導,並支援任意解析度。

wafer-bob/ASASR

ASASR 是一個基於 FLUX.1-dev 的忠實影像超解析度框架,利用對抗 Sobolev 對齊減少偽影並提升放大影像的結構保真度。

bentoml/BentoDiffusion

一個使用 BentoML 框架來自我托管和部署各種 Stable Diffusion 系列模型的範例專案集合。

shiimizu/ComfyUI_smZNodes

自訂 ComfyUI 節點(CLIP Text Encode++ 和 Settings),複製 AUTOMATIC1111 的提示詞解析與嵌入邏輯,使 stable-diffusion-webui 與 ComfyUI 之間的影像生成完全一致。

Windsander/ADI-Stable-Diffusion

一個使用 ONNXRuntime 在多個平台實現高效率、無 Python 依賴的 Stable Diffusion 模型推論的 C++ 庫與 CLI 工具。

mrhan1993/Fooocus-API

為 Fooocus 打造的 FastAPI 驅動 REST API,讓開發者無需手動調整參數,即可透過程式化方式生成高品質圖像。

melMass/comfy_mtb

ComfyUI 的自定義節點集合,透過額外的實用工具擴展圖像生成工作流。

lobehub/sd-webui-lobe-theme

一款為 Stable Diffusion WebUI 設計的現代化、高度可客製化的介面框架,可提升 AI 圖像生成的工作流程與視覺體驗。

yejy53/RealGen

RealGen 是一種文本生成圖像工具,在強化學習過程中使用 AI 檢測器作為獎勵信號,從而生成具有極高寫實感且偽影更少的圖像。

cure-lab/MMA-Diffusion

透過使用多模態對抗性攻擊來繞過提示詞過濾器和安全檢查器以生成 NSFW 內容,從而評估 Text-to-Image 模型的安全性框架。

ATH-MaaS/Ovis-Image

Ovis-Image 是一個 7B 參數的文字生成影像模型,針對高品質文字渲染與版面精準度進行最佳化,設計上能在一般可取得的硬體上高效執行。

nachifur/RDDM

一個用於高品質影像修復與生成的殘差去噪擴散模型框架,支援去雨、去模糊等任務。

viiika/Meissonic

Meissonic 是一種非自回歸掩碼生成 Transformer,專為在消費級 GPU 上執行而設計,可實現高效的高解析度文本到圖像合成。

nxnai/Voost

Voost 是一個統一的 Diffusion Transformer,能夠高品質地雙向虛擬試穿與脫衣,讓使用者可以在人物照片中添加或移除服裝。

Ammmob/PixelSmile

PixelSmile 是一款細緻的臉部表情編輯工具,能在保留人物或動畫角色身份的前提下,改變圖像中的情緒。

nekhtiari/image-similarity-measures

一個 Python 套件與 CLI,用於計算兩張影像之間的八種標準影像相似度指標(RMSE、PSNR、SSIM、FSIM、ISSM、SRE、SAM、UIQ)。透過 pip 安裝,可選加入加速功能,並可使用 `image-similarity-measures` 命令或程式碼中的 `evaluation` 函數。適用於定量評估影像處理或 AI 模型,特別是在遙測領域非常實用。

Stability-AI/stability-sdk

用於 Stability API 的用戶端 SDK,透過 Python 函式庫與命令列工具實現圖像生成、放大與動畫製作。

mo-browser-apps/icons

一款使用 AI 生成 macOS 應用圖示(.icns 格式)的桌面應用,使用者可透過描述期望設計並逐步優化結果。

HalfAI1102/anthropic-art

一個代理技能,以 Anthropic 視覺風格生成手繪編輯插圖,將抽象概念轉化為極簡視覺隱喻。

Nutlope/blinkshot

一個基於 Juggernaut Lightning Flux 與 Together AI 的開源即時 AI 圖像生成器。

Sygil-Dev/sygil-webui

一個為低 VRAM GPU 優化之 Stable Diffusion 網頁端使用者介面,提供圖像生成、放大與提示工程工具。

ShuaixinHuang/image-multiple-angles-3d-camera

一個 3D 控制的影像生成工具,讓使用者能透過互動式 3D 小工具與 Qwen-Image-Edit-Plus 模型,改變上傳影像的相機視角。

Lakonik/LakonLab

用於實驗大型擴散模型的高性能代碼庫,實現了先進的流匹配(flow-matching)與蒸餾技術,以實現高效的幾步圖像生成。

Mukosame/Anime2Sketch

一款使用深度學習將插畫、動漫藝術和漫畫轉換為乾淨線稿與草圖的草圖提取工具。

apple-aiml-research/ml-stable-diffusion

一個用於在 Apple Silicon 上使用 Core ML 轉換與執行 Stable Diffusion 模型的工具包,具備針對行動部署的高階權重壓縮功能。

spectertoucanberth/thumbnail-maker-lab

Thumbnail Maker Lab 是一個專業設計工具包,結合向量圖形與AI驅動的影像編輯及批次處理功能,用於創造縮圖。

cathrynlavery/diagram-design

Diagram Design 是一種 AI 代理技能,可生成大量符合品牌規範的靜態 HTML + SVG 編輯圖表(架構圖、流程圖、圖表、地圖等),提供三種視覺變體,並具備自動色彩/字體導入與無障礙支援。它可與 Claude Code、Codex、Copilot、Factory Droid、Pi、Kiro 及其他代理技能平台整合。

liujuntao123/smart-excalidraw-next

Smart Excalidraw 是一個 Next.js 網頁應用程式,利用大型語言模型(如 Claude sonnet-4.5)將自然語言描述轉換為可編輯的 Excalidraw 圖表。它支援超過 20 種圖表類型、自動路由箭頭,並提供共享伺服器端 LLM(存取密碼)或個人 API 金鑰配置。可透過 pnpm dev 本地執行或使用託管演示。

ramjke/Translumo

Translumo 是一款 Windows 桌面應用程式,可擷取螢幕區域、執行 OCR(Windows OCR、Tesseract、EasyOCR),透過小型 ML 模型選擇最佳結果,並利用 DeepL/Google/Yandex/Papago 翻譯文字,最後將翻譯結果覆蓋於螢幕上。專為遊戲即時使用而設計,支援多種來源/目標語言、代理伺服器輪替及低延遲操作。該專案為開源(Apache 2.0),使用 .NET 8、Visual Studio 2022 及多種 OCR/視覺函式庫構建。

Picsart-AI-Research/MI-GAN

一個針對行動裝置優化的輕量級基於 GAN 的圖像修復模型,在顯著減少參數並加快推理速度的同時,提供與 SOTA 模型相當的高品質結果。

Physton/sd-webui-prompt-all-in-one

一個為 stable-diffusion-webui 設計的擴充功能,透過自動翻譯、提示詞組織工具與 ChatGPT 整合,提升提示詞輸入體驗。

TTPlanetPig/Comfyui_TTP_Toolset

一套 ComfyUI 節點集合,包含 Smart Tile 2.0,這是一種物件感知型平鋪 img2img 工作流,利用語義檢測和可變大小的平鋪塊來實現高細節放大。

leeguooooo/image-use

無需 OpenAI API 金鑰的零相依 Python CLI,可利用現有 ChatGPT 或 Gemini 訂閱產生圖像。

groundboxerrespect/Dlls5-auto

一個透過 REST API 將電影級光照與光暈等寫實神經渲染美學套用至任何影像的自托管影像增強服務。

HyperGAN/HyperGAN

一個基於 PyTorch 的可組合 GAN 框架,讓開發者與藝術家能輕鬆訓練、分享與部署生成對抗網路。