lidge-jun/ima2-gen

Local-first visual generation runtime and studio for people and coding agents, with reproducible image and video workflows across multiple providers.

解决的问题

ima2-gen 提供一个本地优先的视觉生成工作室,简化了在多个 AI 提供商之间创建和迭代图像与视频的过程。它通过将各种 API 和 OAuth 流程整合到单一运行时中,消除了在不同 Web 界面之间切换的需要,同时增加了专业迭代工具,如基于节点的分支、用于清理的画布,以及专为代码代理设计的工作流。

如何工作

该项目充当一个视觉生成运行时和工作室。它连接到广泛的提供方,包括 OpenAI(OAuth/API)、Grok(OAuth/API)、Gemini(通过 Antigravity CLI 或直接 API)、NovelAI 和 ComfyUI。它通过核心注册表管理这些连接,并提供 CLI 和基于 Web 的 UI 供交互使用。

主要操作模式包括:

  • 经典模式:支持参考图像的标准文本到图像/视频生成。
  • 节点模式:允许用户将成功的生成分支到多个方向,创建迭代的视觉图谱。
  • uma 画布模式:一个专门用于缩放、平移、注释和清理背景(包括一键 GPT 透明度工具)的空间。
  • 故事板模式:在连续帧中保持角色和场景的一致性,适用于视频和图像制作。

适用人群

  • 视觉创作者:需要统一界面来操作多个 AI 图像和视频生成器的人。
  • AI 编码代理:项目包含打包的“技能”(Markdown 指令),允许代理使用 ima2 CLI 处理资产生成、前端设计和 UI/UX 发现。
  • 开发者:希望拥有本地优先工具、可复现工作流以及本地画廊用于资产管理的人。

主要亮点

  • 多提供方支持:集成 OpenAI、Grok、Gemini、NovelAI 和 ComfyUI 的访问。
  • 高级迭代功能:基于节点的分支和用于目标清理与注释的画布。
  • 视频功能:通过 Grok 支持文本到视频和图像到视频生成,包括关键帧提取。
  • 代理就绪:专为 AI 编码代理设计的前端和 UI/UX 设计专用技能集。
  • 本地优先:带有会话感知历史和本地提示库导入功能的本地画廊。
  • 矢量化:能够将光栅艺术转换为真实的 SVG 路径。
  • SSE 多路复用:使用单个 Server-Sent Events 连接,防止并发任务时浏览器连接限制。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目