photoprism/photoprism
PhotoPrism 是一款開源的自託管 Web 應用程式,利用裝置端 AI 自動對個人照片和影片進行標籤化、搜尋和整理,同時保護所有數據隱私。
pangxiaobin/image-matting
一款使用 RMBG-1.4 模型提供本地 AI 驅動的背景移除、批次處理與影像編輯工具的桌面應用程式。
AgriciDaniel/banana-claude
Banana Claude 是一個 Claude Code 外掛,讓您輸入自然語言請求,查看詳細計畫(提示、模型、成本估算),在明確批准後呼叫 Google 的 Gemini 圖像模型來產生或編輯視覺資產。它強調離線優先規劃、隱私安全的 API 金鑰處理,以及一次性批准,以保持成本透明。
yolain/ComfyUI-Easy-Use
ComfyUI-Easy-Use 是一套全面的自定義節點,旨在簡化 ComfyUI 可視化編輯器中 Stable Diffusion(及其他擴散模型)工作流的構建。它增加了單鍵加載器、提示詞助手、LoRA/ControlNet 堆疊、循環/條件邏輯、圖像工具和 UI 優化,讓用戶能以更少的節點創建並運行複雜的生成管線。
krea-ai/krea-2
Krea 2 是一個開源影像生成模型,包含一個用於靈活微調的基礎 RAW 模型,以及一個用於快速、高品質文本到影像合成的蒸餾 Turbo 模型。
palxiao/poster-design
一款開源的 AI 海報設計工具與線上圖片編輯器,具備 DOM 畫布、AI 背景移除功能以及完整的管理後台。
nuyoah-ai-works/nuyoah-xiezhen-prompt
一種AI人像攝影提示工程技能,透過重構專業攝影計畫,實現多張照片間一致的風格與角色復現。
nregret/Comfyui-Anima-Tools
專為動漫AI藝術設計的ComfyUI視覺提示與LoRA選擇工具,內建4萬多個藝術家、角色與服裝標籤的資料庫。
AHEKOT/ComfyUI_VNCCS
一個用於創造一致角色圖像的ComfyUI管道,允許使用者在多張圖像中管理外觀、姿勢、服裝與情緒。
lucidrains/denoising-diffusion-pytorch
用於生成高品質圖像及 1D 序列的 Denoising Diffusion Probabilistic Models (DDPM) PyTorch 實作。
buluslan/gpt-image2-ecommerce
一款基於AI的電商視覺資產生成工具,利用39個場景模板與專業技術預檢,生成專業且符合平台要求的產品影像。
wnby/photo-relic-editorial
一個 Codex 技能,透過將真實照片與同一張影像的克制、紙紋版畫版本配對,將照片轉換為垂直的編輯藝術品。
storytold/artcraft
ArtCraft是一款桌面IDE,讓藝術家構建2D或3D場景,並以AI生成的影像、影片、音訊、網格與世界填滿。它提供視覺化工具用於合成、姿勢轉移、背景移除與提示驅動生成,支援62個內建模型以及Midjourney和Sora等外部提供者。適用於Windows/macOS(Linux從原始碼建置),目標使用者是希望實現可重複、可控制的AI藝術工作流程的創作者。
drawthingsai/draw-things-community
一個社群倉庫,提供 Draw Things 應用的核心影像生成、取樣與訓練程式碼,包含可自托管的 gRPC 伺服器以支援遠端推論。
jtydhr88/ComfyUI-qwenmultiangle
一個 ComfyUI 自訂節點,提供互動式 3D 視口,用於控制相機角度並生成與 Qwen-Image-Edit-2511-Multiple-Angles-LoRA 相容的提示。
allenk/GeminiWatermarkTool
一個跨平台的便攜式執行檔,使用確定性反向 Alpha 混合演算法移除 Google Gemini 圖像(及影片)浮水印,具備可選的 GPU 加速 FDnCNN 去噪、GUI/CLI 介面、批次處理以及透過 MCP 實現的 AI Agent 集成。
ATH-MaaS/ComfyUI-Copilot
一個為 ComfyUI 設計的智慧助手,透過 LLM 驅動的代理程式自動化影像生成工作流的生成、除錯與優化。
wzj177/ecommerce-image-suite
一個由 AI 驅動的工具包,協助電商賣家自動分析產品照片,並生成適用於 Amazon、Taobao、JD.com、TikTok 等多種風格與平台的完整專業行銷圖像集。
TaiT-tt/tait-crt-interface-skill
一種 Codex 圖像生成技能,可將照片或文本轉換為具有早期 CRT 電腦介面美學的復古插圖。
Fannovel16/comfyui_controlnet_aux
一系列 ComfyUI 節點,提供用於建立 ControlNet 提示圖像(如深度圖、Canny 邊緣和人體姿勢)的預處理器。
VigoZhao/AI-Visual-Prompt-Cookbook
一個精選的 130+ 個基於 JSON 的視覺風格提示模板庫,用於 AI 圖像生成。每個 `style.json` 定義了一個可重複使用的版面(如海報、拼貼、文字藝術),包含你需在貼到多模態 LLM(ChatGPT‑4‑Vision、Gemini‑3‑Pro 等)前填入的占位符。倉儲包含預覽圖、範例值、驗證腳本和複製提示捷徑,旨在讓 AI 生成的圖形保持一致且易於迭代。
wkentaro/labelme
labelme 是一個跨平台的 Python/Qt 桌面應用程式,可用於在影像或影片上繪製邊界框、多邊形、遮罩等。標註資料以 JSON 格式儲存,可匯出為 VOC 或 COCO 格式,是建立電腦視覺模型訓練資料的實用工具。可透過 pip、付費獨立可執行檔或 Linux 套件安裝;最新版本新增了 AI 輔助遮罩生成(SAM、YOLO-World)功能。
zuruoke/watermark-removal
一個使用影像修補技術來移除影像中的浮水印,並創造出無縫效果的機器學習專案。
dacnay816y62-hub/photo-revival
一套 AI 技能指令,能將普通照片轉化為極簡、充滿詩意的手繪插畫,並帶有大量留白與微小的手寫字幕。
filliptm/ComfyUI_Fill-Nodes
Fill‑Nodes 是一個大型自訂 ComfyUI 節點集合,提供影像處理、視覺效果、字幕生成、AI 模型呼叫(GPT、DALL‑E、Hugging Face 等)、檔案處理(PDF、Google 驅動)、音訊反應與影片工具。透過將倉儲放入 ComfyUI 的 `custom_nodes` 資料夾即可安裝。可用於建構端到端工作流程,實現批次載入、應用創意效果、透過 LLM 生成字幕,並將結果匯出為影像、影片、PDF 或雲端儲存檔案。
six-nut/PocketMen-with-you
一個本地生成工具,可將兩張或更多照片轉換為一致、動畫化的角色精靈,用於 Codex 夥伴,使用開放權重的圖像模型。
Hunyuan-PromptEnhancer/PromptEnhancer
一個使用思維鏈 (Chain-of-Thought) 重寫技術來增強文字轉圖片 (text-to-image) 與圖片轉圖片 (image-to-image) 編輯提示詞,同時保留原始使用者意圖的提示詞重寫工具。
kadevin/ilab-conjure
iLab CONJURE 是一個基於 FastAPI 的本地運行網頁 UI(及 CLI),用於使用多種 AI 模型(GPT-Image、Gemini、Codex)生成和編輯圖像。它提供任務隊列、持久化圖庫、提示詞模板標籤、SQLite 歷史記錄,並支援 OpenAI 兼容 API 和本地 Codex OAuth 流程。可通過源代碼或預構建的 macOS/Windows 安裝包進行安裝,配置 API 金鑰後即可開始生成圖像。
eikek/docspell
Docspell 是一個開源的個人文件管理系統,用於整理掃描的紙本文件、電子郵件及其他檔案。它使用 Stanford CoreNLP 自動建議標籤、日期與發件人,必要時執行 OCR,並透過 REST API 與行動友善的 Elm Web UI 提供全文搜尋。可透過 Docker、Debian 套件、Nix 或 Helm 安裝,採用 AGPL-v3 授權。
SamurAIGPT/Vibe-Workflow
Vibe Workflow 是一個開源、MIT授權的節點式視覺化編輯器,用於建構生成式影像與影片流程。它由 Next.js 前端、調用 MuAPI 生成模型的 FastAPI 後端,以及可重複使用的流程建構 UI 庫組成。你可以透過 Docker 或手動方式自托管,也可使用託管的 SaaS 版本,並可透過自訂節點呼叫任何 AI 模型或外部 API。
NimaNzrii/comfyui-photoshop
一款將 ComfyUI 的 AI 功能直接整合至 Photoshop 界面的插件,實現無縫的 AI 驅動編輯工作流程。
chaiNNer-org/chaiNNer
用於程式化圖像處理與 AI 放大之基於節點的 GUI,允許使用者透過視覺化介面建構可自訂的處理流水線。
PrismML-Eng/Bonsai-Image-Demo
一個跨平台示範,適用於 4 B 參數的 Bonsai 擴散模型,提供基於 Web 的工作室與 CLI,可在 macOS(MLX)或 NVIDIA GPU(gemlite + HQQ)上進行影像生成。
karimz1/imgcompress
一個自託管的圖像處理伺服器,提供本地 AI 驅動的背景移除、批量壓縮與超過 70 種圖像格式的轉換。
trueai-org/midjourney-proxy
一個開源的 Midjourney API 代理,讓開發者能透過可程式化介面,將 Midjourney 的影像生成與人臉交換功能整合至自己的應用中。
YanWenKun/ComfyUI-Windows-Portable
一個即時執行的 Windows 套件,將 ComfyUI(Stable Diffusion 的節點式介面)與 40 多個自訂節點及 300 多個預編譯 Python 套件整合,讓使用者在 NVIDIA GPU 上立即啟動 AI 圖像/影片產生。
Comfy-Org/comfy-cli
comfy‑cli 是一個 Python 命令列工具,用於安裝、啟動和管理 ComfyUI(一個開源生成式媒體引擎)。它處理環境設定、自訂節點安裝、模型下載、工作流程執行,並可將任務卸載到託管的 Comfy Cloud 服務。功能包括基於 `uv` 的快速相依性解析、LLM 代理友好的 JSON 結構化輸出、Shell 补全,以及用於測試 PR 和管理背景伺服器的實用工具。
FireRedTeam/FireRed-Image-Edit
一個通用的圖像編輯模型,提供高保真度、一致性的編輯,並具有強大的身份保留與多元素融合能力。
NVIDIA-RTX/NRD
GPU 加速、與 API 無關的即時光線追蹤去噪庫(REBLUR、RELAX、SIGMA)。
GiMi-Xiaomi/gimi-illustration-skill
一個 AI Agent 技能,可將文字文章與腳本轉換為具有可客製化風格與一致角色 IP 的概念圖。
LibrePhotos/librephotos
LibrePhotos 是一個自架設的照片管理伺服器,可自動添加 AI 生成的元資料(人臉、物件、字幕),並提供語意搜尋、地圖檢視與多使用者相簿功能。它以 Docker 容器形式提供,包含 Django REST 後端、React Web UI 和可選的 React-Native Android 客戶端,所有電腦視覺任務均使用 ONNX-run 模型。
rupeshs/fastsdcpu
一個利用 OpenVINO 與潛在一致性模型優化、專為 CPU 設計的高效率 Stable Diffusion 實作,可實現近乎即時的圖像生成。
nv-tlabs/PiD
PiD 是一款即插即用的擴散解碼器,透過取代標準的 VAE/RAE 解碼器,在單次傳遞中將潛在表示直接轉換為超解析度 2K 到 4K 像素。
Gourieff/ComfyUI-ReActor
一組 ComfyUI 節點,用於在影像和影片中快速且簡單地進行換臉,具備臉部修復與混合臉部模型建立功能。
Nerogar/OneTrainer
一套完整的擴散模型訓練套件,提供資料集準備、微調與模型轉換工具,支援 GUI 或 CLI 操作。
yurijmikhalevich/rclip
rclip 是一款本地、終端機原生型的影像搜尋工具,利用 OpenCLIP 嵌入技術,讓您能透過自然語言描述、範例影像或加權組合來尋找照片,並提供可選的互動式 UI 以及對多種影像格式的支援。
markfulton/NanoBananaEditor
基於 React 與 TypeScript 的編輯器,支援 Google 的 Gemini 圖像模型,實現文字生成圖像、遮罩編輯與搜尋接地提示。
nihui/zimage-ncnn-vulkan
一個基於 ncnn 的可攜式 Z-Image 生成器實作,可在任何支援 Vulkan 的 GPU 上實現高效能圖像生成、圖像修復與 ControlNet 支援。