ChatGPT Plus 및 Enterprise에서의 DALL·E 3 통합

OpenAI는 DALL·E 3를 출시했으며,現在は ChatGPT Plus 및 Enterprise 사용자에게 제공됩니다. 이 모델은 이미지 생성에서 상당한 발전을 나타내며, 시각적 품질 향상, 더 높은 세부 사항, 그리고 복잡하고 상세한 프롬프트를 따르는 능력이 이전 모델보다 향상되었습니다.

프롬프트 준수의 기술적 발전

DALL·E 3는 최첨단 이미지 캡셔너를 활용하여 훈련 데이터에 대한 고품질 텍스트 설명을 생성함으로써 프롬프트 준수 성능을 향상시킵니다. 이러한 개선된 캡션으로 훈련함으로써 모델은 사용자 제공 캡션에 훨씬 더 민감해져 텍스트, 손, 얼굴과 같은 복잡한 세부 사항을 안정적으로 렌더링할 수 있게 됩니다.

시각적 기능 및 포맷팅

DALL·E 3는 이전 버전보다 시각적으로 더 두드러지고 세부 사항이 더 선명한 이미지를 생성합니다. 이 모델은 가로 및 세로 방향을 포함한 다양한 비율을 지원하여 사용자가 유연한 포맷팅 요구 사항을 가진 이미지를 만들 수 있게 합니다.

안전 시스템 및 콘텐츠 모더레이션

OpenAI는 성인, 폭력적 또는 증오스러운 콘텐츠와 같은 유해한 이미지 생성을 방지하기 위해 다층 안전 시스템을 사용합니다. 이 시스템은 사용자에게 제공되기 전에 초기 사용자 프롬프트 및 결과 이미지 모두에 안전 검사를 실행하여 작동합니다.

이러한 시스템을 더욱 개선하기 위해 OpenAI는 전문 레드팀er 및 초기 사용자와 협력하여 보완이 필요한 gaps를 식별하고 해결했습니다. 이 과정은 성적인 이미지와 같은 그래픽 콘텐츠의 경계 사례를 구체적으로 대상으로 삼아 모델이 오해를 일으킬 수 있는 이미지를 생성하는 능력을 테스트했습니다.

예술가 및 공공 인물 보호

배포 준비의 일환으로 OpenAI는 살아있는 예술가의 스타일이나 공공 인물의 이미지를 생성할 모델의 가능성을 제한하기 위한 조치를 시행했습니다. 또한 회사는 생성된 이미지 전반에 걸친 인구 통계적 대표성을 개선하는 데 중점을 두었습니다.

AI 출처 및 감지

OpenAI는 DALL·E 3로 생성된 이미지인지 여부를 식별하도록 설계된 내부 출처 분류기를 평가하고 있습니다. 내부 평가 결과 다음과 같은 정확도율을 보였습니다:

  • Unmodified images: DALL·E 생성 이미지를 식별하는 정확도가 99% 이상입니다.
  • Modified images: JPEG 압축, 크기 조정, 자르기, 실제 이미지 cutout 중첩과 같은 일반적인 수정 사항을 거친 이미지의 경우 정확도가 95% 이상입니다.

これらの結果は強力ですが、OpenAIは現在この分類器が生成の可能性を示すだけであり definitive conclusion(확정적인 결론)을 제공하지 않는다고 지적합니다. 이 도구는 사용자가 AI 생성 시각 콘텐츠와 실제 이미지를 구분할 수 있도록 AI 가치 사슬 전반에 걸쳐 협력하려는 더 넓은 노력의 일부입니다.

Sources