freestylefly/awesome-gpt-image-2
GPT-Image2 用的提示即程式碼系統與模板庫,將散文式提示轉換為穩定可控的 AI 圖像生成結構化協議。
yang0/handraw-style
一個包含216個編號手繪插畫風格的精選庫,附帶即用的雙語提示詞,以及一個簡單的網頁畫廊。使用者只需選擇一個風格ID並加入主題,即可獲得適用於文字到圖像AI的提示詞,無需自行描述風格即可確保視覺語調的一致性。
abi/screenshot-to-code
screenshot‑to‑code 是一款開源應用程式,利用 Gemini、GPT‑5.5 和 Claude 等大語言模型 (LLM),將 UI 截圖、設計稿或短影片錄製轉換為可直接執行的前端程式碼 (HTML/CSS、React、Vue 等),並支援選配的資產提取與視覺預覽。
aldegad/sprite-gen
一個 Python CLI 和智能體技能,使用 AI 生成流水線將單個基礎圖像轉換為遊戲就緒的透明精靈圖集或動畫循環。
perseval-BLR/NeuralScreen
NeuralScreen 是一款 Windows 實用工具,可即時將 NVIDIA 的 DLSS 5 神經上採樣(及可選幀生成)應用於整個桌面或單一視窗,提供更清晰的視覺效果、截圖/錄影工具以及可配置的疊加 UI。
s1dashu/ip-as-logo-skill
一種引導AI代理生成簡單、可愛且具商業價值的IP吉祥物角色的代理技能,確保構圖與風格的一致性。
upscayl/upscayl
一款使用 Real-ESRGAN 和 Vulkan 技術,無損放大並增強低解析度圖像的免費開源 AI 圖像放大器。
wuyoscar/GPT-Image2-Skill
提示圖庫、兩個可重複使用的代理技能(圖像生成與提示萃取),以及 OpenAI 的 GPT-Image 2/2.5 模型的命令列工具。
yanliudesign/mono-color-skill
一個專注於機械複製美學的設計系統與AI技能,用於創建專業級的一或兩色編輯印刷品、海報和包裝。
danielgatis/rembg
一個可作為 CLI、Python 套件或 HTTP 伺服器使用的影像背景移除工具,支援多種 AI 模型與硬體加速。
Nutlope/logocreator
LogoCreator 是一個開源 Web 應用,透過 Together AI 使用 FLUX-2 圖像模型生成品牌就緒的 Logo。使用 Next.js、TypeScript、Radix 和 Tailwind 建構,無需帳戶,只需提供 Together AI 金鑰即可運行。功能包括即時生成、FLUX-1 編輯、PNG/SVG 導出、可選的速率限制與認證,以及歷史儀表板。倉庫提供清晰的設定步驟,並列出未來任務,如尺寸選擇、成本預覽、參考 Logo 上傳,以及著名 Logo 重設計展示。
basketikun/chatgpt2api
一個相容 OpenAI 的 API 代理,透過對 ChatGPT 的 Web 功能進行逆向工程,提供內建帳號池管理的圖像生成與編輯服務。
shitagaki-lab/see-through
一個將單張動漫插畫分解為最多 23 個語義不同、經過修補的圖層,並以 PSD 格式輸出,用於 2.5D 動畫與綁定(rigging)的框架。
yjz211/vivid-figures-skill
Vivid Figures 是一個 Agent-Skill,為 AI 助手提供 143 個現成的圖表範本與 7 種配色方案。透過向助手提供資料檔案(CSV、Excel、JSON)與自然語言請求,該技能可自動選擇合適圖表,產生 PNG/PDF 輸出,並提供可後續調整的完整 Python 原始碼。它遵循開放的 Agent Skills 規範,支援 Python 3.10+,個人非商業用途免費。
Kizzuwatnaa/DLSS5-Autopilot
DLSS 5 Autopilot 是一個 Windows 工具,可自動為從未內建 NVIDIA DLSS 5 神經上採樣功能的遊戲加入此功能。它掃描已安裝的遊戲,根據遊戲的圖形 API 和使用者的 RTX 20–50 GPU,選擇合適的社群附加元件(原生鈎子、OptiScaler、橋接、餵送器、RTX Remix 等),在執行時下載所需 DLL,撰寫設定檔,並可乾淨地卸載所有內容。支援多種啟動器,提供幀生成選項,適用於影片/鏡頭串流,提供 CLI,並包含反作弊系統的安全檢查。
Comfy-Org/ComfyUI-Manager
ComfyUI‑Manager 是一個為視覺化 AI 流程 UI ComfyUI 所設計的擴充功能。它新增了一個「管理器」面板,讓使用者能從精選註冊表或本機快取中瀏覽、安裝、更新、啟用/停用及移除自訂節點套件與模型檔案。功能包括一鍵安裝、基於快照的環境還原、工作流程分享至外部網站、組件複製貼上、無頭模式使用的 CLI 工具,以及廣泛的設定(安全等級、網路模式、pip/uv 處理)。它簡化了 ComfyUI 中驅動 Stable-Diffusion 圖像生成的龐大社群節點生態系統的管理。
T8RIN/ImageToolbox
一款提供 500 多種濾鏡、AI 驅動背景移除與批量處理功能的高效 Android 影像編輯工具。
ostris/ai-toolkit
Ostris AI Toolkit 是一套開源工具組,用於在消費級 GPU 上微調現代擴散模型(影像、影片、音訊、編輯)。它提供網頁 UI、實驗性管理器(可自動安裝正確的 PyTorch/Node.js/FFmpeg 堆疊),以及現成的 YAML 設定檔,用於 LoRA/LoKr 訓練。安裝可透過 Linux/macOS/Windows 的簡單腳本或手動虛擬環境步驟完成。此工具組支援數十種近期檢查點(FLUX-1/2、SDXL、Qwen-Image 等),並包含在 RunPod 和 Modal 上進行雲端執行的指南。
SegFault42/HeliosGen
HeliosGen 是一個開源桌面應用(macOS 已釋出,Windows/Linux 待定),提供一個視覺化的節點式畫布,用於建構與執行 AI 圖像與影片生成流程。它在本機運作,將請求傳送至 kie.ai API(或可選的 Codex CLI),並將所有資料儲存在使用者的機器上。功能包括多模型支援、參考影像、平行/順序執行,以及即時歷史記錄。該應用使用 Tauri 2(Rust)與 Next.js/React 前端建構,使用 SQLite 實現本機持久化,並採用 MIT 授權。
facefusion/facefusion
FaceFusion 是一個高效率的人臉操作平台,可用於在影像與影片中交換與編輯人臉。
worldbench/DiffusionOPSD
DiffusionOPSD 是一個開源實現,用於微調擴散圖像生成器(Stable Diffusion 3.5‑M 和 Z‑Image‑Turbo)的「在策略自我蒸餾」演算法。它會重複從凍結的行為策略中收集低雜訊狀態,利用獎勵梯度步驟建立明確的正負目標,訓練新策略以匹配這些目標,並透過 EMA 更新行為策略。程式碼庫提供安裝相依性、下載獎勵模型檢查點、執行快速煙霧測試,以及啟動全規模分散式訓練的腳本,支援七種公開評估器(PickScore、CLIPScore、HPSv2.1/v3、Aesthetic、ImageReward、DeQA)或混合獎勵目標。報告結果顯示在 19/20 的設定中獲得更高保留分數,且 GPU 使用時間減少 40–63 %。授權條款為 Apache 2.0。
threerocks/hand-drawn-styles
一個工具無關的庫,包含19個經驗證的手繪風格提示配方,AI代理可藉此生成一致且高品質的影像提示。
higgsfield-ai/cli
跨平台命令列介面,用於 Higgsfield 的全套生成式 AI 模型(影像、影片、3D、音訊),以及建構 React 網站、發布瀏覽器遊戲和管理個人「Soul」化身的工具——全部透過終端完成。
LiamGvchi/gc-minimal-zine-poster
一個 Codex 技能,透過結構化提示編譯系統將主題或照片轉化為簡約、紙質感的編輯海報。
NVlabs/Sana
SANA 是 NVIDIA 推出的開源、效率導向的擴散程式碼庫,適用於高解析度影像與影片生成。它包含多個模型家族(SANA、SANA‑1.5、SANA‑Sprint、SANA‑Video/Video 2.0、SANA‑WM、SANA‑Streaming)與強化學習包裝器(Sol‑RL)。關鍵技術包括線性注意力、32× 壓縮自編碼器(DC‑AE)、僅解碼器文字編碼器與 sCM 蒸餾,使 4K 影像生成與長達 1 分鐘的 720p 影片生成的 GPU 成本遠低於類似模型。該儲存庫提供訓練/推論腳本、Hugging Face 上的預訓練檢查點、Diffusers 集成、ComfyUI 節點與示範。授權為 Apache 2.0。
alisaitteke/photoshop-mcp
一個 MCP 伺服器,讓 AI 助手能透過自然語言命令控制 Adobe Photoshop,執行背景移除與人像修飾等任務。
LunarXuan/image-prompt-reverse
一個將參考影像逆向工程為高保真度正負提示的Codex技能,適用於AI圖像生成工具。
invoke-ai/InvokeAI
Invoke AI 是一個開源、本地運行的視覺媒體生成平台。它提供基於 Web 的 UI,具備統一畫布、節點式工作流程編輯器、畫廊管理功能,並支援數十種現代文字轉圖像模型(Stable Diffusion、Flux、Qwen‑Image 等)。使用者透過提供的啟動器安裝,啟動本地伺服器,並透過直覺的瀏覽器介面創建或優化圖像。此專案針對需要彈性、可擴展 AI 圖像創作工具的藝術家、設計師與開發者。
ciddwd/overlay-translator
Screen Translator 是一款 Android 應用,可捕獲螢幕,執行 OCR,透過本機模型、LLM API 或傳統機器翻譯服務進行文字翻譯,並將結果疊加回螢幕。支援即時翻譯、批次影像處理、單字級詞典查詢、TTS 及廣泛自訂功能,提供離線與雲端兩種選項。
Acly/krita-ai-diffusion
一個將生成式 AI 擴散模型整合到 Krita 繪畫工作流程的外掛,提供修補、即時繪畫與精確結構控制等工具。
CookSleep/gpt_image_playground
一個專業級網頁 UI,支援使用 OpenAI 的 gpt-image-2.5 API 進行文字轉影像生成、基於遮罩的編輯以及對話式 AI 代理影像創建
toyxyz/ComfyUI_toyxyz_test_nodes
一組用於網路攝影機/螢幕捕獲、區域遮罩建立、OpenPose 編輯、影片剪輯/串接以及 MiniMax-H3 提示建構的自訂 ComfyUI 節點,支援更豐富的影像與影片生成工作流程。
shanliuling/dsh-image-gen
DeepSeek Harness 的 AI 圖像生成套件,提供基於聊天的生成、批次生產工作室、多模型對比以及本地 ComfyUI 整合。
xororz/local-dream
一款利用 Snapdragon NPU 加速實現高效能本地 Stable Diffusion 圖像生成的 Android 應用。
kijai/ComfyUI-KJNodes
ComfyUI‑KJNodes 是 ComfyUI 的一個外掛程式,增加實用節點、跨子圖 Set/Get 處理功能,以及多種鍵盤/滑鼠快速鍵,使大型生成圖譜的建構與維護更輕鬆。
Hugo-Dz/spritefusion-pixel-snapper
透過將像素對齊到完美的網格並將顏色量化,來修復由 AI 生成的雜亂且不一致的像素藝術的工具。
mcmonkeyprojects/SwarmUI
SwarmUI 是一個開源的基於 Web 的 UI,用於執行 AI 圖像、影片和音訊生成模型(Stable Diffusion、Flux 等)。它提供初學者友善的 Generate 分頁、進階 Comfy 風格工作流編輯器、多 GPU「叢集」支援以及可擴展的插件事。提供 Windows、Linux、macOS(Apple 晶片)和 Docker 的安裝程式,以及用於 Runpod 和 Vast.ai 的雲端 GPU 範本。該專案處於「Almost-Release」測試版(v0.9.8),採用 MIT 授權,但可能會自動安裝 GPL/AGPL 元件。
Comfy-Org/ComfyUI_frontend
ComfyUI_frontend 是 ComfyUI AI 工作流引擎的官方瀏覽器/Electron UI。它提供了一個節點圖編輯器、遮罩編輯器、隊列/歷史記錄查看器、多語言 UI,以及用於自定義面板、命令、按鍵綁定和彈窗通知的 JavaScript 擴展 API。發佈週期遵循 2 週開發 $\rightarrow$ 2 週凍結期循環,並通過啟動參數提供每日 Nightly builds。
jau123/MeiGen-AI-Design-MCP
MeiGen AI 設計 MCP 是一個 MCP 相容伺服器(npm 套件或遠端 HTTP 端點),讓 AI 助手能生成圖像、影片與電商導向的資產(背景移除、產品細節批量生成、行銷海報、AI 背景、放大)。支援 MeiGen 雲端、OpenAI 相容 API 與本地 ComfyUI,提供 1,446 個精心策劃的提示範本,並提供 CLI 與 HTTP API 供非 MCP 使用。
liyue-aigc/xianxia-visual-director
Codex/Agent技能的視覺方向系統,將簡單想法轉化為宏大東方仙俠環境的結構化、電影級圖像提示。
Akegarasu/lora-scripts
用於訓練 Stable Diffusion LoRA 與 Dreambooth 模型的 GUI 與腳本預設集合,提供資料集標記與訓練的整合環境。
popopo-99/zy-cinematic-realism
一個適用於 LLM 的影視視覺工作流程,能將敘事構想轉化為專業且針對特定模型的提示,讓 AI 圖像生成達成真實的影視寫實風格。
lbouaraba/comfyui-krea2edit
基於 Krea 2 的指令式影像編輯 ComfyUI 節點套件,透過雙重潛在與語意條件化實現高保真身分保留。
llmsresearch/paperbanana
PaperBanana 是一個開源 Python 工具,透過多代理 LLM/VLM 流程將方法章節文字(或資料檔案)轉換為出版就緒的圖表與統計圖,支援批次執行、會議特定樣式與多種 AI 提供商。
goohai/Goohaitools-comfyui
一個超過 70 個自訂節點的完整工具包,專為 ComfyUI 設計,用於專業影像製作,專注於批次處理、自動化證件照製作與進階遮罩操作。
carolinaaafy/travel-memory-sticker-card
一個將旅行照片轉化為可收藏數位記憶貼紙卡片的 Codex 技能。
jtydhr88/ComfyUI-See-through
一個ComfyUI插件,可將單張動漫插畫分解為具有深度順序的分層2.5D模型,專為Live2D工作流程設計。
TheJoeFin/Text-Grab
Text Grab 是一款僅限 Windows 的桌面應用,使用本地 OCR(WinAI、WinRT OCR 或 Tesseract)捕獲任何可見文字(截圖、PDF、UI 元素等),並提供內建清理、電子表格編輯、正規表示式基礎提取、可重複使用的擷取範本、批量資料夾處理與 Chrome/Edge 擴充功能。所有處理皆在本機進行,Copilot+ PC 上可選 NPU 加速推論。可透過 Microsoft Store、GitHub 發布版或套件管理員安裝;原始碼可用 Visual Studio 或 .NET SDK 建構。