baidu/ERNIE-Image
一個由百度推出的開放權重 8B Diffusion Transformer 文本到圖像模型,擅長文字渲染、複雜指令執行以及結構化視覺構圖。
wildminder/ComfyUI-DyPE
一個 ComfyUI 自定義節點包,透過無需訓練的模型修補(model patching)和級聯細化(cascade refinement)技術,讓 FLUX 和 Qwen Image 等 Diffusion Transformers 生成超高解析度(4K+)的圖像。
martin-rizzo/ComfyUI-ZImagePowerNodes
一組為 Z-Image Turbo 模型優化之 ComfyUI 自訂節點,提供增強的風格控制、低步驟一致性與構圖多樣性。
LuqP2/Image-MetaHub
Image MetaHub 是一款本地優先的桌面應用程式(Electron + React),用於索引 AI 生成的影像、影片和音訊,從 ComfyUI、Automatic1111、InvokeAI、Midjourney 等工具中提取生成中繼資料,並提供快速多面向搜尋、視覺相似性搜尋、譜系追蹤和嵌入式 ComfyUI 工作區。核心應用程式開源(MPL 2.0),$39 離線 Pro 授權解鎖進階整合、比較檢視、無限叢集和分析功能。
CVCUDA/CV-CUDA
CV‑CUDA 是 NVIDIA 的開源 GPU 加速電腦視覺函式庫。它提供快速、可擴展的影像/影片運算子(調整大小、濾鏡、色彩轉換等),這些運算子完全在 GPU 上執行,並與 C/C++ 和 Python AI 框架整合。透過 Linux 的預先建置 wheels (`cvcuda-cu12` 或 `cvcuda-cu13`) 進行安裝,使用 `nvimgcodec` 將影像直接解碼至 GPU,並在將資料傳送至深度學習模型之前串聯 CV‑CUDA 運算子。該函式庫針對現代 NVIDIA GPU (Turing 及更新版本) 設計,並應用於 Microsoft Bing 視覺搜尋和 Tencent Cloud 影片處理等生產系統中。
carson-katri/dream-textures
一個 Blender 外掛程式,整合 Stable Diffusion,直接在 3D 工作區內生成無縫紋理、概念藝術和圖像資產。
damian0815/compel
適用於 transformers 型文本嵌入系統的文本提示權重與混合庫,可精確控制圖像生成流水線中提示的影響。
YukihoAA/waifu2x_snowshell
一個用於 waifu2x、Real-CUGAN 和 Real-ESRGAN 等多個 AI 圖像放大工具的 GUI 外殼,提供圖像增強的拖曳介面。
thekevinscott/UpscalerJS
一個可在瀏覽器或 Node.js 中使用 AI 實現影像解析度提升、去噪和去模糊的 JavaScript 套件。
Dana-Farber-AIOS/pathml
PathML 是一個開源的 Python 函式庫(亦提供 Docker 映像),可簡化全片病理工作流程:載入多種切片格式、執行可擴展的前處理(染色正規化、切片、GPU 轉換)、將資料轉換為 PyTorch 張量、建構細胞層級圖形,並執行深度學習或 ONNX 模型。它旨在降低 AI 驅動的計算病理門檻,已在多篇高影響力的生醫出版物中使用。
adobe-research/custom-diffusion
一種快速且高效的方法,用於微調文字到圖像擴散模型,從少量圖像中學習新概念,且僅需極少的儲存空間。
hollowstrawberry/kohya-colab
一組用於準備資料集與訓練 Stable Diffusion LoRA 模型的 Google Colab 筆記本,支援 SDXL。
e-sensing/sits
SITS 是一個開源 R 套件(附帶 Python 包裝器),用於建構、正則化與分類衛星影像時序資料立方體。它可連接多個公開地球觀測資料集,提供一系列 ML/DL 模型(包括 GPU 加速的 CNN 與注意力編碼器),並提供從訓練、分類、平滑、不確定性估計到主動學習的端對端工具。
facefusion/facefusion-docker
基於 Docker 的 FaceFusion 人臉操作平台部署方案,讓使用者能輕鬆在 CUDA 與 ROCm 等多種硬體加速器上執行該軟體。
SerialLain3170/AwesomeAnimeResearch
專注於動畫與卡通生成的精選研究論文與數據集集合,涵蓋從圖像合成到動畫製作的各個主題。
google-deepmind/dm_pix
PIX 是一個基於 JAX 的影像處理函式庫,提供 GPU/TPU 加速的函式(例如:翻轉、縮放),這些函式可以使用 `jax.jit` 進行編譯、使用 `jax.vmap` 進行向量化,或使用 `jax.pmap` 在多個裝置上執行。請先安裝 JAX,然後執行 `pip install dm-pix`。其用法與 NumPy 影像程式碼完全相同,但具備完整的 JAX 效能與自動微分功能。
dangeng/visual_anagrams
使用基於像素的擴散模型生成多視角錯覺圖的工具,可創建在旋轉、翻轉或重新排列時會改變身份的圖像。
UCSC-VLAA/story-iter
一個無需訓練的迭代框架,用於長篇故事視覺化,透過全域參考交叉注意力模組在最多 100 幀中保持語意一致性。
Shilin-LU/MACE
MACE 是一個用於擴散模型的微調框架,能夠大規模抹除多達 100 個不想要的概念(例如名人或露骨內容),同時保留與之無關的模型知識。
Weistrass/DyRef
一個兩階段訓練框架,使用動態獎勵最佳化使影像生成模型能夠準確結合多張不同類型的參考影像。
ussoewwin/ComfyUI-QwenImageLoraLoader
一組 ComfyUI 自訂節點,可載入並堆疊 Nunchaku Qwen‑Image、Z‑Image‑Turbo 與 Krea2 ControlNet 模型的 LoRA 權重,支援 UI 控制、實驗性 AWQ 調製支援與 DiffSynth ControlNet 集成。
zsyOAOA/ResShift
ResShift 是一種高效的擴散模型,用於影像超解析度與復原,透過減少抽樣步驟提升推論速度,同時不犧牲影像品質。
mrslimslim/gpt-image-canvas
一個以本地為首的 AI 圖像工作區,結合無限畫布與基於 DAG 的代理規劃,適用於多步驟提示轉圖像生成。
bcmi/libcom
一個提供統一工具集的影像合成工具箱,用於實現逼真的物件插入,包括調和、陰影生成與放置評估。
giriss/comfy-image-saver
一組用於在 ComfyUI 中儲存嵌入生成元資料影像的自訂節點,確保與 Civitai 和 Prompthero 相容。
fallenshock/FlowEdit
FlowEdit 是 ICCV 2025 論文的開源 PyTorch 實作,透過重用預訓練擴散模型(如 Stable Diffusion 3、Flux)與流網路,實現無需昂貴潛在空間反演的快速文本引導影像編輯。使用者提供來源影像、來源說明與目標說明,系統即可產生簡潔的編輯碼並輸出編輯後影像。倉儲包含可直接執行的指令碼、基於 YAML 的設定,以及 ComfyUI 節點連結,便於廣泛整合。
haidog-yaqub/MeanFlow
A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.
open-mmlab/PowerPaint
支援文字引導物件插入、物件移除與外繪的多功能圖像修復模型。
VoxelCubes/PanelCleaner
Panel Cleaner 是一個開源的 Python 工具,利用機器學習模型定位並遮蓋漫畫對話氣泡中的文字,然後可選擇性地移除文字(支援可選的 LaMa 圖像修復)或透過 OCR 提取文字。支援命令列與 Qt GUI,具備批次處理、CUDA 加速與可配置的設定檔功能。專案採用 GPL-v3 授權,可透過 pip 套件、預建二進位檔、Flatpak、AUR 與 Docker 鏡像取得。
mittagessen/kraken
kraken 是一個開源、基於 Python 的 OCR 工具包,專為歷史文獻與非拉丁文字設計。提供可訓練的版面分析、閱讀順序偵測與神經網路字元辨識,支援由右至左、雙向與垂直文字。輸出標準 XML 格式(ALTO、PageXML、hOCR),提供單詞級邊界框,並附帶公開模型倉儲。可透過 pip/pipx 在 Linux 或 macOS 上安裝,使用 `kraken get …` 取得模型,再透過一行指令完成圖像的二值化、分段與 OCR。
gongnyang/gongnyang-prompt-kit
專為 Claude Code 設計的提示編譯工具包,可將模糊的影像請求轉化為適用於 gpt-image-2 的專業且經過驗證的提示
zjx0101/ObjectClear
ObjectClear 是一個物件移除模型,能夠聯合消除目標物件及其相關效應(如陰影),同時保持背景一致性。
joeylitalien/noise2noise-pytorch
Noise2Noise 論文的非官方 PyTorch 實現,提供腳本以使用高斯、泊松、文字疊加或蒙特卡洛渲染噪聲,在僅含噪數據上訓練和測試 U‑Net 去噪器。
apple-aiml-research/ml-gmpi
一種具備 3D 感知能力的生成模型,可將 2D GANs 轉換為多平面影像 (Multiplane Images),以實現 3D 視角合成與網格提取。
apple-aiml-research/ml-mdm
一個用於套娃擴散模型的端到端框架,能夠高效訓練最高1024x1024像素的高解析度文字到圖像合成模型。
a312863063/generators-with-stylegan2
一系列基於 StyleGAN2 的臉部生成器,可為電影、廣告和遊戲產業提供高保真度、獨特的虛擬人臉。
ModelTC/LightX2V-Qwen-Image-Lightning
Qwen‑Image 文字轉圖像模型的蒸餾、更快速版本(4 或 8 步擴散),提供 fp32/bf16/fp8 檢查點、LoRA 介面卡,以及開箱即用的 ComfyUI 工作流程。提供 12–25 倍的加速,僅有輕微的品質損失,並可與 Diffusers、ComfyUI、Nunchaku 和 Cache‑dit 整合。
hako-mikan/sd-webui-supermerger
一個針對 AUTOMATIC1111 的 Stable Diffusion WebUI 的模型合併擴充功能,允許使用者在記憶體中合併模型,並進行區塊級權重調整,無需儲存至磁碟。
lucidrains/autoregressive-diffusion-pytorch
一個基於 PyTorch 的自回歸影像生成實作,透過使用擴散模型方法來消除對向量量化(vector quantization)的需求。
alexandre01/deepsvg
一個使用深度學習與可微分張量來創造與動畫化向量圖形(SVG)的分層生成網路與程式庫。
huangzh13/StyleGAN.pytorch
一個用於生成高解析度逼真圖像的原始 StyleGAN 架構的歷史性 PyTorch 實作。
Jonseed/ComfyUI-Detail-Daemon
一組專為 Flux 與 SDXL 模型優化之 ComfyUI 節點,透過在採樣過程中調整雜訊排程(sigmas),強化圖像細節並減少背景模糊。
giddyyupp/ganilla
GANILLA 的 PyTorch 實作,這是一個旨在將真實圖像轉換為藝術插圖的生成對抗網路。
facefusion/facefusion-pinokio
FaceFusion Pinokio 是一個臉部操作平台,透過 Pinokio 提供簡化的安裝流程,讓使用者能輕鬆在影像與影片中交換與修改臉部。
TencentARC/ColorFlow
ColorFlow 是一個檢索增強的擴散框架,可在保持角色與物件身分一致的前提下,為黑白影像序列上色。
cracker0dks/CaptchaSolver
CaptchaSolver 是一個 JDownloader 2 插件,利用透過 Node.js 執行的 YOLO/Darknet 神經網路模型,自動解決少數檔案主機網站的 6 位與幾何驗證碼。它提供 Windows/Linux(amd64)的預編譯二進位檔,並提供其他平台的建置說明,讓使用者能在伺服器或 NAS 裝置上完全無人值守地運行 JDownloader。
Nutlope/easyedit
EasyEdit 是一個由 Flux 2 和 Together AI 驅動的提示式圖像編輯工具,允許使用者僅透過單一文字提示修改圖片。
mmartial/ComfyUI-Nvidia-Docker
支援 NVIDIA GPU 加速的 ComfyUI Stable‑Diffusion Web UI 的 Docker 映像,提供 GPU 專用標籤、UID/GID 對應與內建 ComfyUI‑Manager,便於輕鬆更新。