lidge-jun/ima2-gen
Local-first visual generation runtime and studio for people and coding agents, with reproducible image and video workflows across multiple providers.
解决的问题
ima2-gen 提供一个本地优先的视觉生成工作室,简化了在多个 AI 提供商之间创建和迭代图像与视频的过程。它通过将各种 API 和 OAuth 流程整合到单一运行时中,消除了在不同 Web 界面之间切换的需要,同时增加了专业迭代工具,如基于节点的分支、用于清理的画布,以及专为代码代理设计的工作流。
如何工作
该项目充当一个视觉生成运行时和工作室。它连接到广泛的提供方,包括 OpenAI(OAuth/API)、Grok(OAuth/API)、Gemini(通过 Antigravity CLI 或直接 API)、NovelAI 和 ComfyUI。它通过核心注册表管理这些连接,并提供 CLI 和基于 Web 的 UI 供交互使用。
主要操作模式包括:
- 经典模式:支持参考图像的标准文本到图像/视频生成。
- 节点模式:允许用户将成功的生成分支到多个方向,创建迭代的视觉图谱。
- uma 画布模式:一个专门用于缩放、平移、注释和清理背景(包括一键 GPT 透明度工具)的空间。
- 故事板模式:在连续帧中保持角色和场景的一致性,适用于视频和图像制作。
适用人群
- 视觉创作者:需要统一界面来操作多个 AI 图像和视频生成器的人。
- AI 编码代理:项目包含打包的“技能”(Markdown 指令),允许代理使用
ima2CLI 处理资产生成、前端设计和 UI/UX 发现。 - 开发者:希望拥有本地优先工具、可复现工作流以及本地画廊用于资产管理的人。
主要亮点
- 多提供方支持:集成 OpenAI、Grok、Gemini、NovelAI 和 ComfyUI 的访问。
- 高级迭代功能:基于节点的分支和用于目标清理与注释的画布。
- 视频功能:通过 Grok 支持文本到视频和图像到视频生成,包括关键帧提取。
- 代理就绪:专为 AI 编码代理设计的前端和 UI/UX 设计专用技能集。
- 本地优先:带有会话感知历史和本地提示库导入功能的本地画廊。
- 矢量化:能够将光栅艺术转换为真实的 SVG 路径。
- SSE 多路复用:使用单个 Server-Sent Events 连接,防止并发任务时浏览器连接限制。
相关
- 项目
- 项目
- 项目
- 项目
- 项目