lidge-jun/ima2-gen

Local-first visual generation runtime and studio for people and coding agents, with reproducible image and video workflows across multiple providers.

解決的問題

ima2-gen 提供一個本地優先的視覺生成工作室,簡化在多個 AI 提供商之間創建與迭代圖像及影片的過程。它透過將各種 API 與 OAuth 流程整合至單一執行環境,消除切換不同 Web 界面的需要,同時加入專業的迭代工具,如節點式分支、用於清理的畫布,以及專為程式碼代理設計的工作流程。

如何運作

此專案扮演視覺生成執行環境與工作室的角色。它可連接廣泛的提供者,包括 OpenAI(OAuth/API)、Grok(OAuth/API)、Gemini(透過 Antigravity CLI 或直接 API)、NovelAI 與 ComfyUI。它透過核心註冊表管理這些連接,並提供 CLI 與基於 Web 的 UI 供互動使用。

主要操作模式包括:

  • 經典模式:支援參考影像的標準文字轉圖像/影片生成。
  • 節點模式:允許使用者將成功的生成分支至多個方向,建立迭代的視覺圖譜。
  • uma 畫布模式:專為縮放、平移、註解與背景清理(含一鍵 GPT 透明度工具)設計的空間。
  • 故事板模式:在連續畫格中維持角色與場景的一致性,適用於影片與圖像製作。

適用對象

  • 視覺創作者:需要統一介面來操作多個 AI 圖像與影片生成器的人。
  • AI 程式碼代理:專案包含打包的「技能」(Markdown 指示),讓代理可使用 ima2 CLI 進行資產產生、前端設計與 UI/UX 探索。
  • 開發者:希望擁有本地優先工具、可重現工作流程與本地圖庫進行資產管理的人。

主要亮點

  • 多提供方支援:整合 OpenAI、Grok、Gemini、NovelAI 與 ComfyUI 的存取。
  • 高階迭代功能:節點式分支與用於目標清理與註解的畫布。
  • 影片功能:透過 Grok 支援文字轉影片與圖像轉影片生成,包含關鍵幀提取。
  • 代理就緒:專為 AI 程式碼代理設計的前端與 UI/UX 設計專用技能集。
  • 本地優先:具備會話感知歷史與本地提示庫匯入功能的本地圖庫。
  • 向量化:可將光柵藝術轉換為真實的 SVG 路徑。
  • SSE 多路複用:使用單一 Server-Sent Events 連接,防止並行任務時瀏覽器連接限制。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案