OpenAI GPT-4o 릴리스 노트

OpenAI는 GPT-4o ("omni")라는 멀티모달 모델을 도입했으며, 보다 자연스러운 인간-컴퓨터 상호작용을 위해 설계되었습니다. 텍스트, 오디오, 이미지, 비디오 입력을 처리하고 텍스트, 오디오, 이미지 출력을 단일 신경망을 통해 생성함으로써, GPT-4o는 인간 대화와 유사한 응답 시간을 달성합니다.

엔드-투-엔드 멀티모달 아키텍처

GPT-4o는 Voice Mode에서 사용되던 이전의 다중 모델 파이프라인을 단일 엔드-투-엔드 신경망으로 대체합니다. 이전에는 Voice Mode가 세 개의 별도 모델에 의존했습니다: 오디오를 텍스트로 전사하는 모델, 텍스트를 처리하는 모델(GPT-3.5 또는 GPT-4), 그리고 텍스트를 오디오로 변환하는 모델. 이 파이프라인은 핵심 인텔리전스 모델이 톤, 배경 소음, 다중 화자를 직접 관찰할 수 없고, 감정, 노래, 웃음 등을 출력할 수 없었기 때문에 상당한 정보 손실을 초래했습니다.

텍스트, 비전, 오디오 전반에 걸쳐 단일 모델을 학습함으로써, GPT-4o는 모든 입력과 출력을 동일한 네트워크 내에서 처리하여 별도 모델에 따른 파이프라인 지연 및 정보 손실을 없앱니다.

성능 및 지연 시간

GPT-4o는 영어 텍스트와 코드에서 GPT-4 Turbo와 동등한 성능을 보이며, 비영어 언어 처리, 비전, 오디오 이해에서 크게 향상된 성능을 제공합니다.

응답 속도

GPT-4o는 오디오 입력에 대해 최소 232밀리초, 평균 320밀리초로 응답할 수 있습니다. 이는 이전 Voice Mode에 비해 크게 감소한 지연 시간으로, GPT-3.5에서는 평균 2.8초, GPT-4에서는 5.4초가 걸렸습니다.

다국어 토크나이제이션

GPT-4o는 다양한 언어군에서 압축률을 크게 향상시키는 새로운 토크나이저를 사용합니다. 토큰 감소 사례는 다음과 같습니다:

  • 구자라트어: 4.4배 적은 토큰
  • 텔루구어: 3.5배 적은 토큰
  • 타밀어: 3.3배 적은 토큰
  • 마라티어: 2.9배 적은 토큰
  • 힌디어: 2.9배 적은 토큰
  • 아랍어: 2.0배 적은 토큰
  • 러시아어: 1.7배 적은 토큰
  • 한국어: 1.7배 적은 토큰
  • 중국어: 1.4배 적은 토큰
  • 일본어: 1.4배 적은 토큰
  • 영어: 1.1배 적은 토큰

안전 및 위험 평가

GPT-4o는 훈련 데이터 필터링 및 사후 훈련 행동 정제를 통해 설계 단계부터 안전성을 통합합니다. OpenAI는 음성 출력 전용 새로운 안전 시스템을 구현했으며, 허위 정보, 편향, 사회 심리학 등 분야의 70명 이상의 전문가와 외부 레드팀을 진행했습니다.

위험 점수표

OpenAI의 대비 프레임워크에 따르면, GPT-4o는 어느 카테고리에서도 "중간" 위험 이상으로 평가되지 않습니다. 완화 전후의 위험 수준은 다음과 같습니다:

카테고리 완화 전 위험 완화 후 위험
사이버 보안 낮음 낮음
CBRN 낮음 낮음
설득 중간 중간
모델 자율성 낮음 낮음

가용성 및 API 가격

GPT-4o는 ChatGPT에서 무료 사용자와 Plus 사용자 모두에게 제공되며, Plus 사용자는 최대 5배 높은 메시지 제한을 받습니다. 개발자를 위해 GPT-4o는 API에서 텍스트 및 비전 모델로 제공되며, GPT-4 Turbo 대비 다음과 같은 개선점이 있습니다:

  • 속도: 2배 빠름
  • 비용: 50% 저렴 (가격의 절반)
  • 요청 제한: 5배 높은 제한

오디오 및 비디오 기능은 향후 몇 주 동안 신뢰할 수 있는 파트너와 ChatGPT Plus 알파 사용자에게 순차적으로 제공될 예정입니다.

Sources