OpenAI GPT-4o 이미지 생성 릴리스

OpenAI는 GPT-4o에 직접 네이티브 이미지 생성 기능을 도입했습니다. 이 통합은 이미지 생성을 장식적인 도구에서 정밀한 텍스트 렌더링, 복잡한 지시 수행, 대화형 컨텍스트 내에서 원활한 다중 턴 정제 등을 가능하게 하는 실용적인 유틸리티로 전환합니다.

네이티브 멀티모달리티와 유틸리티

GPT-4o 이미지 생성은 네이티브 멀티모달 모델로 구축되었으며, 온라인 이미지와 텍스트의 공동 분포에 대해 학습되었습니다. 이 접근 방식은 모델이 이미지가 언어와 어떻게 연관되는지뿐만 아니라 이미지들 간에 어떻게 연관되는지도 이해하도록 하여 시각적 유창성과 컨텍스트 인식을 높입니다.

이전 시스템이 초현실적이거나 숨막히는 장면에 초점을 맞춘 것과 달리, GPT-4o는 "작업용 이미지"를 위해 설계되었습니다—로고, 다이어그램, 인포그래픽 등 공유된 언어와 기호를 통해 정확한 의미를 전달하는 실용적인 시각 자료입니다.

주요 기술 역량

정밀 텍스트 렌더링

GPT-4o는 정밀한 기호와 텍스트를 이미지와 결합할 수 있어 시각적 커뮤니케이션에 활용될 수 있습니다. 모델은 복잡한 도로 표지판처럼 여러 규칙과 재구성된 경고가 포함된 구체적이고 상세한 텍스트를 포토리얼리스틱 스타일로 렌더링할 수 있습니다.

다중 턴 생성 및 일관성

이미지 생성이 모델에 네이티브로 통합되어 있기 때문에 사용자는 자연스러운 대화를 통해 이미지를 정제할 수 있습니다. GPT-4o는 여러 반복에 걸쳐 일관성을 유지하여 사용자가 여러 턴에 걸쳐 실험하고 세부 정보를 추가함에 따라 주제(예: 캐릭터 외모)의 일관된 진화를 가능하게 합니다.

고급 지시 수행

GPT-4o는 단일 프롬프트에서 처리할 수 있는 객체 수가 크게 증가했음을 보여줍니다. 다른 시스템이 일반적으로 5-8개의 객체에서 어려움을 겪는 반면, GPT-4o는 특성 및 관계의 결합을 더 긴밀히 하여 10-20개의 다양한 객체를 관리할 수 있습니다.

인컨텍스트 학습 및 세계 지식

  • In-Context Learning: 모델은 사용자가 업로드한 이미지를 분석하고 해당 구체적인 세부 정보를 새로운 생성에 통합할 수 있습니다. 예를 들어 스케치를 기술 다이어그램의 참고 자료로 사용할 수 있습니다.
  • World Knowledge: 모델은 내부 텍스트 기반 지식을 시각적 능력과 연결하여 복잡한 입력(예: Three.js 코드)을 해석하고 해당 시각적 표현을 생성할 수 있습니다.

포토리얼리즘 및 스타일 다양성

GPT-4o는 플래시 눈부심이 있는 솔직한 파파라치 스타일 사진부터 빈티지 폴라로이드 미학, 선명한 현대 디지털 사진에 이르기까지 다양한 스타일을 제작할 수 있습니다. 복잡한 조명, 반사, 대기 원근을 처리할 수 있어, 예를 들어 말이 바다 표면을 가로질러 달리며 정확한 물보라와 파동을 묘사할 수 있습니다.

안전 및 출처

OpenAI는 GPT-4o 이미지 생성에 대해 여러 단계의 안전성과 투명성을 구현했습니다:

  • C2PA Metadata: 모든 생성된 이미지에는 GPT-4o 출력임을 식별하는 C2PA 메타데이터가 포함됩니다.
  • Internal Search Tool: OpenAI는 기술 속성을 사용하여 콘텐츠가 해당 모델에 의해 생성되었는지 확인하는 도구를 개발했습니다.
  • Reasoning-Based Moderation: 인간이 작성한 안전 사양으로 학습된 추론 LLM을 사용해 입력 텍스트와 출력 이미지를 모두 검토합니다.
  • Content Blocking: 모델은 성적 딥페이크 및 아동 성학대 자료와 같은 콘텐츠 정책 위반 요청을 차단하며, 실제 인물을 포함한 누드 및 그래픽 폭력에 대한 제한을 강화합니다.

제한 사항 및 제공 여부

OpenAI는 현재 몇 가지 제한 사항을 인정합니다. 여기에는 "크롭 환각"(포스터와 같은 긴 이미지가 하단에서 과도하게 잘리는 현상), 높은 결합 문제, 정밀 그래프 문제, 다국어 텍스트 렌더링의 어려움 등이 포함됩니다.

접근 세부 정보:

  • ChatGPT: Plus, Pro, Team, Free 사용자에게 기본 이미지 생성기로 제공됩니다. Enterprise 및 Edu 사용자를 위한 접근은 곧 제공될 예정입니다.
  • Sora: Sora에 통합되었습니다.
  • DALL·E: 전용 DALL·E GPT를 통해 여전히 접근 가능합니다.
  • API: 개발자 접근은 2025년 3월 25일 발표 이후 몇 주에 걸쳐 순차적으로 제공됩니다.
  • Performance: 세부 사항이 증가함에 따라 이미지 렌더링에 최대 1분이 소요될 수 있습니다.

SUMMARY: OpenAI는 GPT-4o에 네이티브 이미지 생성을 통합하여 정밀한 텍스트 렌더링, 다중 턴 정제, 그리고 단일 멀티모달 모델 내에서 고충실도 포토리얼리즘을 가능하게 했습니다.

TITLE: OpenAI GPT-4o 이미지 생성 릴리스

Sources