OpenAI GPT-4o 릴리스 노트
OpenAI는 GPT-4o ("omni")라는 멀티모달 모델을 도입했으며, 보다 자연스러운 인간-컴퓨터 상호작용을 위해 설계되었습니다. 텍스트, 오디오, 이미지, 비디오 입력을 처리하고 텍스트, 오디오, 이미지 출력을 단일 신경망을 통해 생성함으로써, GPT-4o는 인간 대화와 유사한 응답 시간을 달성합니다.
엔드-투-엔드 멀티모달 아키텍처
GPT-4o는 Voice Mode에서 사용되던 이전의 다중 모델 파이프라인을 단일 엔드-투-엔드 신경망으로 대체합니다. 이전에는 Voice Mode가 세 개의 별도 모델에 의존했습니다: 오디오를 텍스트로 전사하는 모델, 텍스트를 처리하는 모델(GPT-3.5 또는 GPT-4), 그리고 텍스트를 오디오로 변환하는 모델. 이 파이프라인은 핵심 인텔리전스 모델이 톤, 배경 소음, 다중 화자를 직접 관찰할 수 없고, 감정, 노래, 웃음 등을 출력할 수 없었기 때문에 상당한 정보 손실을 초래했습니다.
텍스트, 비전, 오디오 전반에 걸쳐 단일 모델을 학습함으로써, GPT-4o는 모든 입력과 출력을 동일한 네트워크 내에서 처리하여 별도 모델에 따른 파이프라인 지연 및 정보 손실을 없앱니다.
성능 및 지연 시간
GPT-4o는 영어 텍스트와 코드에서 GPT-4 Turbo와 동등한 성능을 보이며, 비영어 언어 처리, 비전, 오디오 이해에서 크게 향상된 성능을 제공합니다.
응답 속도
GPT-4o는 오디오 입력에 대해 최소 232밀리초, 평균 320밀리초로 응답할 수 있습니다. 이는 이전 Voice Mode에 비해 크게 감소한 지연 시간으로, GPT-3.5에서는 평균 2.8초, GPT-4에서는 5.4초가 걸렸습니다.
다국어 토크나이제이션
GPT-4o는 다양한 언어군에서 압축률을 크게 향상시키는 새로운 토크나이저를 사용합니다. 토큰 감소 사례는 다음과 같습니다:
- 구자라트어: 4.4배 적은 토큰
- 텔루구어: 3.5배 적은 토큰
- 타밀어: 3.3배 적은 토큰
- 마라티어: 2.9배 적은 토큰
- 힌디어: 2.9배 적은 토큰
- 아랍어: 2.0배 적은 토큰
- 러시아어: 1.7배 적은 토큰
- 한국어: 1.7배 적은 토큰
- 중국어: 1.4배 적은 토큰
- 일본어: 1.4배 적은 토큰
- 영어: 1.1배 적은 토큰
안전 및 위험 평가
GPT-4o는 훈련 데이터 필터링 및 사후 훈련 행동 정제를 통해 설계 단계부터 안전성을 통합합니다. OpenAI는 음성 출력 전용 새로운 안전 시스템을 구현했으며, 허위 정보, 편향, 사회 심리학 등 분야의 70명 이상의 전문가와 외부 레드팀을 진행했습니다.
위험 점수표
OpenAI의 대비 프레임워크에 따르면, GPT-4o는 어느 카테고리에서도 "중간" 위험 이상으로 평가되지 않습니다. 완화 전후의 위험 수준은 다음과 같습니다:
| 카테고리 | 완화 전 위험 | 완화 후 위험 |
|---|---|---|
| 사이버 보안 | 낮음 | 낮음 |
| CBRN | 낮음 | 낮음 |
| 설득 | 중간 | 중간 |
| 모델 자율성 | 낮음 | 낮음 |
가용성 및 API 가격
GPT-4o는 ChatGPT에서 무료 사용자와 Plus 사용자 모두에게 제공되며, Plus 사용자는 최대 5배 높은 메시지 제한을 받습니다. 개발자를 위해 GPT-4o는 API에서 텍스트 및 비전 모델로 제공되며, GPT-4 Turbo 대비 다음과 같은 개선점이 있습니다:
- 속도: 2배 빠름
- 비용: 50% 저렴 (가격의 절반)
- 요청 제한: 5배 높은 제한
오디오 및 비디오 기능은 향후 몇 주 동안 신뢰할 수 있는 파트너와 ChatGPT Plus 알파 사용자에게 순차적으로 제공될 예정입니다.
Sources
- OriginalHello GPT-4o