lidge-jun/ima2-gen

Local-first visual generation runtime and studio for people and coding agents, with reproducible image and video workflows across multiple providers.

해결하는 문제

ima2-gen은 여러 AI 제공업체를 통해 이미지 및 동영상 생성을 단순화하는 로컬 우선의 시각적 생성 스튜디오를 제공합니다. 다양한 웹 인터페이스를 전환할 필요 없이, 다양한 API 및 OAuth 흐름을 단일 런타임에 통합하며, 노드 기반 분기, 캔버스를 통한 정리, 코드 에이전트를 위한 전용 워크플로우와 같은 전문적인 반복 도구를 추가합니다.

작동 방식

이 프로젝트는 시각적 생성 런타임 및 스튜디오로 작동합니다. OpenAI (OAuth/API), Grok (OAuth/API), Gemini (Antigravity CLI 또는 직접 API), NovelAI, ComfyUI 등 다양한 제공업체에 연결할 수 있습니다. 이러한 연결은 핵심 레지스트리를 통해 관리되며, CLI와 웹 기반 UI를 통해 상호작용할 수 있습니다.

주요 운영 모드는 다음과 같습니다:

  • 클래식 모드: 참조 이미지 지원이 있는 표준 텍스트에서 이미지/동영상 생성.
  • 노드 모드: 성공적인 생성물을 여러 방향으로 분기하여 시각적 반복 그래프를 생성할 수 있습니다.
  • uma 캔버스 모드: 줌, 패닝, 주석, 배경 정리(일클릭 GPT 투명도 도구 포함)에 특화된 공간.
  • 스토리보드 모드: 동영상 및 이미지 제작에서 캐릭터와 장면의 연속성을 유지합니다.

대상 사용자

  • 시각적 창작자: 여러 AI 이미지 및 동영상 생성기의 통합 인터페이스가 필요한 사람.
  • AI 코드 에이전트: ima2 CLI를 사용해 자산 생성, 프론트엔드 디자인, UI/UX 탐색을 수행할 수 있는 패키지화된 "스킬"(Markdown 지침)을 포함합니다.
  • 개발자: 재현 가능한 워크플로우와 로컬 갤러리 기반의 자산 관리가 가능한 로컬 우선 도구를 원하는 사람.

주요 특징

  • 다중 제공업체 지원: OpenAI, Grok, Gemini, NovelAI, ComfyUI에 대한 통합 접근.
  • 고급 반복 기능: 노드 기반 분기 및 타겟 정리 및 주석을 위한 캔버스.
  • 동영상 기능: Grok를 통해 텍스트에서 동영상, 이미지에서 동영상 생성 및 키프레임 추출 지원.
  • 에이전트 대응: AI 코드 에이전트를 위한 프론트엔드 및 UI/UX 디자인 전용 스킬 세트.
  • 로컬 우선: 세션 인식 기록과 로컬 프롬프트 라이브러리 가져오기 기능이 있는 로컬 갤러리.
  • 벡터화: 래스터 아트를 실제 SVG 경로로 추적 가능.
  • SSE 멀티플렉싱: 병렬 작업 중 브라우저 연결 제한을 방지하기 위해 단일 Server-Sent Events 연결을 사용.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트