OpenAI DevDay 2023: GPT-4 Turbo, Assistants API, 및 멀티모달 업데이트

OpenAI는 128K 컨텍스트 윈도우를 갖춘 보다 강력하고 비용 효율적인 모델인 GPT-4 Turbo와 AI 에이전트 생성을 간소화하도록 설계된 새로운 Assistants API를 소개했습니다. DevDay에서 발표된 이 업데이트들은 플랫폼의 멀티모달 기능을 크게 확장하고 개발자들의 비용을 낮춥니다.

GPT-4 Turbo: 확장된 컨텍스트와 낮은 비용

GPT-4 Turbo는 GPT-4 모델의 차세대 버전으로, 단일 프롬프트에서 300페이지 이상의 텍스트를 처리할 수 있는 128K 컨텍스트 윈도우를 특징으로 합니다. 이 모델은 2023년 4월까지의 최신 세계 사건에 대한 지식을 갖추고 있으며 gpt-4-1106-preview API 엔드포인트를 통해 사용할 수 있습니다.

가격 및 성능

GPT-4 Turbo는 이전 모델보다 훨씬 저렴합니다. 입력 토큰은 GPT-4에 비해 3배 저렴하게 ($0.01 per 1k tokens), 출력 토큰은 2배 저렴하게 ($0.03 per 1k tokens) 제공됩니다.

기술 향상

  • Parallel Function Calling: 개발자는 이제 단일 메시지에서 여러 함수를 호출할 수 있어 복잡한 요청에 필요한 라운드트립 수를 줄일 수 있습니다.
  • JSON Mode: 새로운 response_format 매개변수는 모델이 구문적으로 올바른 JSON을 생성하도록 보장하여 Chat Completions API를 사용하는 개발자의 신뢰성을 향상시킵니다.
  • Reproducible Outputs: seed 매개변수의 도입으로 보다 일관된 완성을 제공할 수 있어 디버깅 및 단위 테스트에 중요합니다.
  • Log Probabilities: OpenAI는 곧 GPT-4 Turbo와 GPT-3.5 Turbo 모두에 대해 가장 가능성이 높은 출력 토큰의 로그 확률을 반환하는 기능을 지원할 예정입니다.

업데이트된 GPT-3.5 Turbo

OpenAI는 기본적으로 16K 컨텍스트 윈도우를 지원하는 새로운 버전의 GPT-3.5 Turbo (gpt-3.5-turbo-1106)를 출시했습니다. 내부 평가에서는 JSON, XML, YAML 생성과 같은 포맷 준수 작업에서 38% 향상이 나타났습니다.

Assistants API: AI 에이전트 구축

Assistants API는 개발자가 특정 지시와 도구 접근 권한을 가진 목적에 맞는 AI를 만들어 "에이전트와 같은" 경험을 구축할 수 있게 합니다. 주요 혁신은 지속적이고 무한히 긴 스레드를 사용하는 것으로, 상태 관리를 OpenAI에 위임하고 기존 컨텍스트 윈도우 제한을 우회합니다.

통합 도구

  • Code Interpreter: 어시스턴트가 샌드박스 환경에서 Python 코드를 작성하고 실행하여 수학 문제를 해결하거나 차트를 생성할 수 있게 합니다.
  • Retrieval: 개발자가 자체 임베딩이나 청크 알고리즘을 구현할 필요 없이 어시스턴트가 독점 도메인 데이터나 사용자가 제공한 문서에 접근할 수 있게 합니다.
  • Function Calling: 어시스턴트가 사용자 정의 함수를 호출하고 그 응답을 메시지에 포함할 수 있게 합니다.

새로운 멀티모달 기능

OpenAI는 API를 확장하여 비전, 이미지 생성 및 음성 합성을 포함했습니다:

  • GPT-4 Turbo with Vision: gpt-4-vision-preview를 통해 접근할 수 있으며, 모델이 이미지를 분석하고 캡션을 생성하며 도표가 포함된 문서를 읽을 수 있게 합니다.
  • DALL·E 3: 이제 Images API (dall-e-3)를 통해 사용할 수 있으며, 개발자가 내장된 모더레이션 기능으로 프로그래밍 방식으로 이미지를 생성할 수 있습니다.
  • Text-to-Speech (TTS): 새로운 API는 텍스트에서 인간 수준의 음성을 제공하며, 여섯 가지 사전 설정 음성 및 두 가지 변형(tts-1(실시간 최적화) 및 tts-1-hd(품질 최적화))을 지원합니다.

모델 커스터마이징 및 파인튜닝

OpenAI는 모델 커스터마이징을 위한 두 가지 경로를 도입하고 있습니다:

  1. GPT-4 Fine-Tuning: GPT-4 파인튜닝을 위한 실험적 접근 프로그램이 마련되고 있지만, 초기 결과는 GPT-3.5에 비해 의미 있는 향상을 얻기 위해 더 많은 노력이 필요함을 시사합니다.
  2. Custom Models Program: 방대한 독점 데이터셋(수십억 토큰)을 보유한 조직을 대상으로, OpenAI 연구원과 협력하여 사전 학습 단계부터 맞춤형 GPT-4 모델을 훈련시키는 제한적이며 고비용 프로그램입니다.

플랫폼 인프라 및 법적 보호

가격 및 속도 제한

OpenAI는 플랫폼 전반에 걸쳐 가격을 인하했습니다. 특히 GPT-3.5 Turbo 16K 입력 토큰은 이제 3배 저렴하게 ($0.001 per 1k tokens) 제공되며, 출력 토큰은 2배 저렴하게 ($0.002 per 1k tokens) 제공됩니다. 또한, 모든 유료 GPT-4 고객에 대한 분당 토큰 제한이 두 배로 늘어났습니다.

저작권 보호막

OpenAI는 "Copyright Shield"를 도입했으며, 이는 고객이 ChatGPT Enterprise 및 개발자 플랫폼의 일반적으로 제공되는 기능 사용과 관련된 저작권 침해 청구를 받을 경우 방어하고 법적 비용을 부담하겠다는 약속입니다.

오픈소스 릴리스

  • Whisper large-v3: 다국어 성능이 향상된 차세대 오픈소스 자동 음성 인식(ASR) 모델입니다.
  • Consistency Decoder: Stable Diffusion 1.0+ VAE와 호환되는 이미지에서 텍스트, 얼굴, 직선의 렌더링을 개선하는 오픈소스 대체 디코더입니다.

SUMMARY: OpenAI는 128K 컨텍스트 윈도우를 갖춘 GPT-4 Turbo, 에이전트와 같은 경험을 위한 새로운 Assistants API, 그리고 DALL·E 3와 TTS를 포함한 확장된 멀티모달 기능을 발표했습니다.

TITLE: OpenAI DevDay 2023: GPT-4 Turbo, Assistants API, 및 멀티모달 업데이트

Sources