GPT-4o 이미지 생성 시스템 카드 추가
OpenAI는 GPT-4o 옴니모달 아키텍처에 네이티브로 통합된 새로운 이미지 생성 기능을 출시하여 포토리얼리스틱 출력과 고급 이미지-이미지 변환을 가능하게 합니다. 이 통합을 통해 모델은 전체 내부 지식 베이스를 활용하여 이전 DALL·E 3 시리즈가 만든 이미지보다 더 표현력이 풍부하고 유용한 이미지를 생성할 수 있습니다.
향상된 이미지 생성 기능
GPT-4o 이미지 생성은 현실성, 유연성, 정밀성에 초점을 맞춰 DALL·E 3 시리즈보다 몇 가지 중요한 기술적 발전을 제공합니다:
- 포토리얼리즘: 모델은 높은 수준의 포토리얼리즘 품질을 가진 이미지를 생성할 수 있습니다.
- 이미지-이미지 변환: 이전 버전과 달리, 시스템은 기존 이미지를 입력으로 받아 사용자 지시에 따라 변환할 수 있습니다.
- 텍스트 통합: 모델은 생성된 이미지에 특정 텍스트를 신뢰성 있게 포함시킬 수 있으며, 타이포그래피와 배치에 대한 상세한 지시를 따릅니다.
- 네이티브 옴니모달 통합: 생성 기능이 GPT-4o 아키텍처 내부에 깊게 내장되어 있기 때문에, 모델은 더 넓은 추론과 지식을 이미지 생성에 적용하여 보다 미세하고 표현력 있는 결과를 만들어냅니다.
안전 및 위험 완화
OpenAI는 DALL·E와 Sora의 배포에서 얻은 기존 안전 인프라와 통찰력을 활용하여 새로운 이미지 생성 기능을 보호합니다. 시스템은 기존 안전 프로토콜의 이점을 얻지만, 향상된 기능은 새로운 경미한 위험을 도입합니다. OpenAI가 이러한 위험을 관리하는 접근 방식은 다음과 같습니다:
- 이전 모델로부터의 교훈 적용: DALL·E와 Sora의 배포 데이터 및 안전 학습을 활용합니다.
- 표적 위험 평가: 옴니모달 모델 내에 이미지 생성의 네이티브 통합과 관련된 특정 경미한 위험을 식별하고 해결합니다.