Steve-Mr/EmojiFace
FaceMoji(EmojiFace)是一款 Android 與 Web 應用,使用 YOLOv8‑face 模型在本機偵測人臉,並以表情符號或模糊效果覆蓋。支援離線運作、手動編輯、自訂表情符號字型,可作為僅透過分享啟動的隱藏圖示應用安裝。
tmchow/illo-skill
一個讓 AI 代理產生帶有重複吉祥物的印刷風格插圖與圖表的外掛程式。
mirabarukaso/character_select_stand_alone_app
用於 AI 影像生成的獨立介面。提供視覺角色選擇、半自動標籤補全,以及與 ComfyUI 和 Forge Neo 的 API 整合。
lquesada/ComfyUI-Inpaint-CropAndStitch
一個 ComfyUI 擴充,透過裁切遮罩區域、在目標解析度下處理並無縫縫合回原始影像,實現修復最佳化。
RoseKhlifa/Image-Studio
一個使用 SSE 和 WebSocket 模式防止長時間推論任務中連接逾時的跨平台圖像生成與編輯客戶端。
nova452/Rebalance-Pack
一系列自定義 ComfyUI 節點,旨在簡化圖像生成和編輯,並提供對 Krea 2 和 Ideogram 4 模型的專門支持。
framepipe-dev/media-inference-worker
一個小型 Python 客戶端,透過文字提示呼叫內部影像生成服務(例如 qwen-image-3)。安裝相依性,使用模型名稱與提示執行 `generate.py`,其他端點請參閱 `RUNBOOK.md`。
ShiftHackZ/Stable-Diffusion-KMP
一款適用於 Android 和 iOS 的開源跨平台 AI 圖像生成用戶端,可連接至自託管 Stable Diffusion 伺服器、雲端 API 和本地裝置執行階段。
civitai/civitai
一個用於分享、發現與協作開發 Stable Diffusion 模型及 AI 生成客製化內容的社群平台。
Kosinkadink/ComfyUI-Advanced-ControlNet
一套用於進階 ControlNet 調度的 ComfyUI 節點,允許使用關鍵影格和自定義權重對整個時間步和批處理潛變量進行精確的強度控制。
Azornes/Comfyui-LayerForge
ComfyUI 的分層畫布編輯器節點,支援在瀏覽器中進行圖像合成、多邊形修復選擇和背景移除。
Code-with-Beto/snapai
一個 CLI 工具,讓移動開發者可使用 OpenAI 和 Google Gemini 圖像模型生成應用圖示與 Google Play 特性圖形。
unconv-ai/Un-0
基於 Kuramoto 動力學的圖像生成模型,透過整合耦合振子而非使用擴散或迭代去噪來生成圖像。
TeamMoeAI/MoeSR
一款利用深度學習模型,專門針對 ACGN 插畫、CG 與漫畫優化的影像超解析度與修復工具。
ssitu/ComfyUI_UltimateSDUpscale
一組 ComfyUI 節點,透過分塊(tiled)方法對大圖進行圖生圖擴散,以提升細節並降低硬體需求。
vladmandic/sdnext
基於 Stable Diffusion 的 AI 圖像與影片生成綜合 Web 介面,具有先進的記憶體優化與廣泛的硬體支援。
facebookresearch/stable_signature
一個將不可見水印直接嵌入生成式 AI 模型的 LDM 解碼器的系統,用於自動辨識 AI 生成的圖像。
yuanchenyang/smalldiffusion
一個輕量級的擴散庫,用於訓練與抽樣擴散與流模型,提供簡潔的核心,便於在 U‑Net 與 DiT 架構上進行實驗。
Topkill/tianruoocr
TianRuo OCR v6 是一款 Windows 桌面應用,可捕獲螢幕文字,透過 PaddleOCR/RapidOCR 實現線上或離線 OCR,並使用多種線上服務進行翻譯。支援一般、靜音、截圖與剪貼簿監聽模式,可配置快捷鍵,支援印刷體、表格與手寫文字識別。
cardenluo/ComfyUI-Apt_Preset
ComfyUI‑Apt_Preset 是視覺化 AI 工作流工具 ComfyUI 的外掛。它將載入、control-net 和取樣步驟打包為預設驅動的節點,提供適用於多種模型家族的通用載入器、用於影片/動畫/control-net 的控制器堆疊、組合取樣器節點以及實用圖像/遮罩工具。透過複製到 `custom_nodes` 並執行 `install.bat` 進行安裝;可選的配套外掛和資源包可增加額外功能。該外掛簡化了複雜的圖像生成圖,使其更易于構建和維護。
intel/openvino-ai-plugins-gimp
OpenVINO AI 插件 for GIMP 透過 Intel OpenVINO 為 GIMP 3 加入本地 AI 功能(超解析度、語意分割,以及包含 FastSD 在內的多種 Stable-Diffusion 變體),支援 CPU/GPU/NPU 推理。依照提供的 Windows/Linux 指南安裝,載入模型後即可在編輯器內直接生成或編輯影像。
gmberton/vismatch
vismatch 是一個 Python 庫,將 50 多種圖像匹配模型(如 SIFT-LightGlue、LoFTR、SuperPoint-LightGlue)封裝在單一、易於使用的 API 之後。它處理模型下載、圖像載入、匹配與可視化,並提供 CLI 工具用於批次處理。該專案旨在簡化對前沿視覺對應方法的實驗與比較。
chflame163/ComfyUI_LayerStyle
一套為 ComfyUI 提供類 Photoshop 圖層與蒙版合成功能的節點,減少對外部編輯軟體的的需求。
YouMind-OpenLab/nano-banana-pro-prompts-recommend-skill
一項 AI 代理技能,可協助 AI 助手搜尋並推薦適用於 Nano Banana Pro(Gemini)圖像生成模型的 10,000+ 個精選提示。
wildminder/ComfyUI-DyPE
一個 ComfyUI 自定義節點包,透過無需訓練的模型修補(model patching)和級聯細化(cascade refinement)技術,讓 FLUX 和 Qwen Image 等 Diffusion Transformers 生成超高解析度(4K+)的圖像。
sepandhaghighi/samila
一個生成藝術產生器,透過根據數學公式與隨機參數計算數千個點,來生成獨特圖像。
wooyeolbaek/attention-map-diffusers
attention‑map‑diffusers 是一個 Python 庫,可捕獲並可視化 Hugging Face Diffusers 圖像與影片生成管道中的注意力張量,讓使用者能看見提示、圖像區塊或影片幀如何相互影響。
Tencent-Hunyuan/HY-SOAR
HY-SOAR 是一種無獎勵的後訓練方法,針對擴散模型的曝光偏差進行校正,透過教導模型在生成過程中自行修正軌跡錯誤。
SalesforceAIResearch/DiffusionDPO
一個用於 Diffusion-DPO 的訓練框架,透過直接偏好優化(Direct Preference Optimization)將 Stable Diffusion 等圖像生成模型與人類偏好對齊。
rohitgandikota/sliders
一個用於建立 LoRA 適配器的框架,這些適配器充當滑桿,可在 Stable Diffusion 與 FLUX 等擴散模型中精確控制特定視覺概念。
yejy53/GenClaw
GenClaw 是一個用於圖像生成的程式碼驅動代理框架,它使用可執行的視覺草圖(SVG、HTML/CSS)作為可控畫布,然後再進行最終渲染。
KohakuBlueleaf/LyCORIS
一個實作 LoHa 與 LoKr 等多種參數高效微調演算法的函式庫,讓 Stable Diffusion 在極小儲存與運算開銷下實現高品質模型客製化。
MochiDiffusion/MochiDiffusion
專為 Apple Silicon 設計的 macOS 原生應用程式,用於在本地執行 Stable Diffusion 與 FLUX.2 Klein,透過 Core ML 優化了高性能與低記憶體佔用。
EutropicAI/Final2x
一款使用 AI 將影像放大並支援自訂模型與現代 Nvidia GPU 的跨平台影像超解析工具。
hako-mikan/sd-webui-regional-prompter
AUTOMATIC1111 的 Stable Diffusion WebUI 用的自訂腳本,允許使用者為影像的不同區域指定不同的提示詞,以防止提示詞滲漏。
easydiffusion/easydiffusion
Stable Diffusion 的一鍵安裝程式與使用者介面,讓使用者無需技術知識即可在本地執行強大的圖像生成 AI。
OpenModelDB/open-model-database
一個由社群驅動的資料庫,可發現、比較與下載超過 600 個 AI 圖像與影片上採樣模型,並附有詳細的元資料。
runpod-workers/worker-comfyui
RunPod 上的 ComfyUI 無伺服器封裝器,允許使用者透過可擴展的 API 端點執行複雜的圖像生成工作流。
lynote-ai/ai-image-detector
AI Image Detector 是一個開源的 Python 工具,用於估計圖像是由 AI 產生的可能性。它內建多種即用型後端(UnivFD、Sentry、Nonescape、混合集成)並允許你只需執行單一指令 (`aidetect detect …`) 於檔案或資料夾,即可輸出機率與標籤。可選的 extras 提供 Gradio 網頁 UI 或 FastAPI 伺服器。此倉庫還包含基準測試腳本、閾值校準,以及選擇後端的清晰指引。它是一個輕量、一次安裝、隨處可執行的 AI 圖像偵測工具,並有文件說明其限制(無全域保證、無區域層級定位)。
gazingstars123/Anima-Standalone-Trainer
一個為 Anima 模型進行 LoRA 微調的輕量級訓練環境,配備有 Web UI。
KohakuBlueleaf/z-tipo-extension
適用於 SD-WebUI、Forge 與 ComfyUI 的提示詞擴展外掛,利用 TIPO 與 DanTagGen LLM 將簡單標籤或標題轉換為詳細的影像生成提示詞。
boogu-project/Boogu-Image
一個開源的統一圖像生成與編輯模型家族,提供高品質的文本轉圖像生成與精確的圖像編輯能力,具備強大的中英文雙語文字渲染功能。
ByteVisionLab/DreamLite
DreamLite 是一個緊湊的 0.39B 參數統一擴散模型,可在裝置端完全實現超快速的 1024x1024 影像生成與編輯。
computational-cell-analytics/micro-sam
micro_sam 是一個基於 napari 的庫,將 Meta 的 Segment Anything 模型適配用於顯微鏡成像。它提供僅需幾次點擊即可完成的互動式 2D/3D 分割與追蹤,包含顯微鏡專用微調的 SAM 權重,並提供可選的自動提示生成與輕量級微調工具。
vvvvvjdy/D-OPSD
D-OPSD 是一個在線策略自我蒸餾框架,允許步進式蒸餾擴散模型在保持快速推理能力的同時,持續地針對新風格和概念進行微調。
pcb9382/PlateRecognition
PlateRecognition 是一個基於 YOLO-v5/v7/v8 和 TensorRT 的開源、多區域車牌檢測與 OCR 系統。它可在桌面端、伺服器、Android/iOS 以及多種邊緣 AI 晶片上運行,在現代硬體上可提供 >99% 的準確度與低於 50 ms 的延遲。該專案提供 C/C++ 和 Python API,支援多種語言,並包含網頁版 Demo 與測試代碼。
danforthcenter/plantcv
PlantCV 是一個用於高通量植物表型分析的開源 Python 庫。它提供模組化的電腦視覺功能(如分割、性狀萃取等),可串接成自訂分析流程。可透過 pip 或 conda 安裝,並附有完整的文件、教學與活躍的貢獻者社群。
hustvl/Moebius
Moebius 是一個輕量級 0.22B 參數圖像修復框架,透過架構優化與知識蒸餾,實現 100 億級品質與 15 倍更快的推論速度。