lidge-jun/ima2-gen

Minimal CLI + web UI for OpenAI GPT Image 2 generation. Dual auth: API Key (paid) or OAuth via ChatGPT (free). Text-to-image, image-to-image, parallel gen, custom sizes.

해결하고자 하는 문제

iima2-gen 은 로컬 데스크톱과 같은 웹 애플리케이션을 제공하여, ChatGPT 또는 Grok와 같은 고급 AI 채팅 인터페이스에서 제공되는 이미지 및 비디오 생성 워크플로를 복제하고, 고급 전문 도구를 추가합니다. 여러 웹 탭과 API 대시보드 사이를 전환할 필요 없이, 생성, 반복 편집 및 자산 관리를 하나의 로컬 스튜디오에 통합합니다.

작동 방식

이 프로젝트는 로컬 서버와 클라이언트 역할을 하며, OAuth 또는 API 키를 통해 다양한 AI 제공자와 인터페이스합니다. 생성을 위한 여러 "경로"를 지원합니다:

  • OAuth 경로: ChatGPT와 Grok 계정에 연결하여 수동 API 키 없이 무료/표준 접근을 제공합니다.
  • API 경로: OpenAI, xAI(Grok), Google Gemini(직접 API 또는 Antigravity CLI)를 통합합니다.

단일 Server‑Sent Events(SSE) 연결을 사용해 다수의 동시 생성 작업에 대한 진행 상황 업데이트를 다중화함으로써, 브라우저 연결 제한으로 인한 갤러리 정지를 방지합니다.

대상 사용자

디자이너, 프론트엔드 엔지니어, AI 아티스트를 위해 설계되었으며, 시각 자산을 생산하기 위한 구조화된 반복 워크플로가 필요한 사람, 프레임 간 캐릭터 일관성을 유지하거나 특정 이미지 정리를 수행하고자 하는 사람에게 적합합니다.

주요 기능

  • 반복 생성 모드: 단일 결과를 위한 "Classic", 단일 이미지에서 다양한 창의적 방향으로 분기하는 "Node Mode", 여러 후보를 한 번에 생성하는 "Multimode"를 포함합니다.
  • 비디오 제작: 텍스트‑투‑비디오, 이미지‑투‑비디오, 레퍼런스‑투‑비디오를 Grok 모델로 지원하며, 키프레임 추출도 가능합니다.
  • 스토리보드 모드: 이미지와 비디오의 연속 프레임에서 캐릭터와 씬 연속성을 유지합니다.
  • 캔버스 모드: 확대, 패닝, 주석 달기, 알파/매트 내보내기 옵션을 제공하는 전용 정리 도구입니다.
  • 에이전트 스킬: 사전 패키징된 Markdown 지시 세트(Core, Frontend, UI/UX)를 제공하여 AI 코딩 에이전트가 자산 제작 파이프라인을 자동화하도록 돕습니다.
  • 로컬 갤러리: 생성된 자산을 로컬에 저장하고, 세션 인식 히스토리와 메타데이터를 유지합니다.