lidge-jun/ima2-gen
Minimal CLI + web UI for OpenAI GPT Image 2 generation. Dual auth: API Key (paid) or OAuth via ChatGPT (free). Text-to-image, image-to-image, parallel gen, custom sizes.
它解決了什麼問題
iima2-gen 提供類似桌面應用的本地 Web 應用,複製高階 AI 聊天介面(如 ChatGPT 或 Grok)中圖像與影片生成的工作流程,並加入進階的專業工具。它透過將生成、迭代編輯與資產管理整合於單一本地工作室,省去在多個網頁分頁與 API 儀表板之間切換的需求。
它如何運作
此專案作為本地伺服器與客戶端,透過 OAuth 或 API 金鑰與各種 AI 供應商介面。它支援多條「路徑」進行生成:
- OAuth 路徑:連接 ChatGPT 與 Grok 帳號,提供免費/標準存取,無需手動 API 金鑰。
- API 路徑:整合 OpenAI、xAI(Grok)與 Google Gemini(透過直接 API 或 Antigravity CLI)。
它使用單一 Server‑Sent Events(SSE)連線,對多個同時生成工作進行進度多路復用,避免瀏覽器連線上限導致畫廊卡住。
目標使用者
此工具為設計師、前端工程師與 AI 藝術家打造,適合需要結構化、迭代式工作流程來產出視覺資產的使用者,尤其是需要在多幀間保持角色一致性或執行目標圖像清理的人。
重點功能
- 迭代生成模式:包含「Classic」單一結果模式、「Node Mode」從單張圖像分支不同創意方向,以及「Multimode」一次產生多個候選。
- 影片製作:支援文字轉影片、圖像轉影片與參考影片生成(使用 Grok 模型),並支援關鍵幀抽取。
- 分鏡腳本模式:在連續幀的圖像與影片中保持角色與場景連貫性。
- 畫布模式:專用清理工具,可放大、平移、註解,並以 alpha/matte 匯出背景。
- 代理技能:提供預先封裝的 Markdown 指令集(Core、Frontend、UI/UX),協助 AI 程式碼代理自動化資產製作流程。
- 本地畫廊:將生成的資產本地儲存,具備會話感知的歷史與中繼資料。