OpenAI o1 및 개발자 도구 업데이트 2024년 12월

OpenAI는 API에 프로덕션 준비가 완료된 o1 추론 모델을 도입했으며, Realtime API 업데이트, 새로운 Preference Fine-Tuning 방식, 그리고 Go 및 Java용 베타 SDK를 함께 발표했습니다. 이번 업데이트는 에이전트형 애플리케이션의 추론 능력 향상, 실시간 오디오 상호작용 비용 절감, 그리고 모델 동작에 대한 더욱 세밀한 제어 제공에 중점을 두고 있습니다.

OpenAI o1 API 통합

OpenAI o1은 복잡하고 다단계인 작업을 위해 설계된 추론 모델로, 이제 사용량 티어 5(usage tier 5)의 개발자가 사용할 수 있습니다. 이 모델은 o1-preview의 후속 모델이며, 몇 가지 새로운 기술적 기능을 통해 프로덕션 환경에 최적화되었습니다.

주요 기술적 특징

  • Function Calling 및 Structured Outputs: o1은 이제 외부 API 및 데이터 소스에 연결할 수 있으며, 사용자 정의 JSON Schemas를 준수하는 응답을 안정적으로 생성할 수 있습니다.
  • 시각적 능력(Vision Capabilities): 모델이 시각적 입력을 추론할 수 있어 코딩, 제조 및 과학 분야의 애플리케이션에 활용이 가능합니다.
  • 개발자 메시지(Developer Messages): 개발자는 이제 개발자 메시지를 통해 톤과 스타일 같은 구체적인 행동 지침을 제공할 수 있습니다.
  • 추론 제어(Reasoning Control): 새로운 reasoning_effort API 파라미터를 통해 개발자가 모델이 답변을 생성하기 전 사고 과정의 지속 시간을 제어할 수 있습니다.
  • 효율성: o1 모델은 동일한 요청에 대해 o1-preview보다 평균 60% 적은 추론 토큰을 사용합니다.

o1-2024-12-17 성능 벤치마크

최신 스냅샷(o1-2024-12-17)은 o1-preview와 비교했을 때 여러 영역에서 최첨단(state-of-the-art) 결과를 보여줍니다:

카테고리 평가 o1-2024-12-17 o1-preview
General GPQA diamond 75.7 73.3
General MMLU (pass @1) 91.8 90.8
Coding SWE-bench Verified 48.9 41.3
Coding LiveBench (Coding) 76.6 52.3
Math MATH (pass @1) 96.4 85.5
Math AIME 2024 (pass @1) 79.2 42.0
Math MGSM (pass @1) 89.3 90.8
Vision MMMU (pass @1) 77.3
Vision MathVista (pass @1) 71.0
Factuality SimpleQA 42.6 42.4
Agents TAU-bench (retail) 73.5
Agents TAU-bench (airline) 54.2

OpenAI는 o1-2024-12-17이 Structured Outputs 및 function calling 테스트에서 gpt-4o를 크게 능가한다고 보고했습니다.

Realtime API 개선 사항

Realtime API 업데이트는 음성 기반 애플리케이션의 접근성을 개선하고 운영 비용을 절감하는 데 중점을 둡니다.

WebRTC 통합

OpenAI는 브라우저, 모바일 클라이언트 및 IoT 기기 전반에서 실시간 음성 제품의 확장을 단순화하는 개방형 표준인 WebRTC 지원을 추가했습니다. 이 통합은 가변적인 네트워크 품질에도 불구하고 응답성 있는 상호작용을 보장하기 위해 혼잡 제어, 소음 억제, 오디오 스트리밍 및 인코딩을 처리합니다.

가격 및 모델 업데이트

Realtime API 베타를 위한 두 개의 새로운 스냅샷이 출시되었습니다:

  • gpt-4o-realtime-preview-2024-12-17: 향상된 음질과 받아쓰기된 숫자에 대한 더 신뢰할 수 있는 입력을 제공합니다. 오디오 토큰 가격이 60% 인하되었습니다 ($40/1M 입력, $80/1M 출력). 캐시된 오디오 입력 비용은 87.5% 감소하여 $2.50/1M 입력 토큰이 되었습니다.
  • gpt-4o-mini-realtime-preview-2024-12-17: mini 모델의 비용 효율성을 Realtime API에 가져옵니다. 오디오 가격은 입력당 $10/1M, 출력당 $20/1M 토큰으로 설정되었습니다. 텍스트 토큰은 입력당 $0.60/1M, 출력당 $2.40/1M 토큰입니다.

Preference Fine-Tuning

OpenAI는 응답의 쌍별 비교를 기반으로 모델을 맞춤화하는 Direct Preference Optimization (DPO)를 사용하는 맞춤화 기술인 Preference Fine-Tuning (PFT)을 도입했습니다.

PFT vs. Supervised Fine-Tuning (SFT)

레이블이 지정된 출력을 복제하는 SFT와 달리, PFT는 선호되지 않는 동작보다 선호되는 동작을 우선시하도록 모델을 최적화합니다.

특징 Supervised Fine-Tuning (SFT) Preference Fine-Tuning (PFT)
목표 정확성을 위해 레이블이 지정된 출력 복제 선호되는 응답 강화 및 선호되지 않는 응답 감소
학습 데이터 정확한 입력/출력 쌍 선호되는 출력과 선호되지 않는 출력의 쌍
사용 사례 엄격한 정확성, 사용자 정의 코드 형식 창의적 글쓰기 또는 요약과 같은 주관적 작업

실제 적용 사례

Rogo AI는 PFT를 사용하여 금융 AI 어시스턴트의 out-of-distribution 쿼리 확장 처리 능력을 개선했습니다. 그들의 Rogo-Golden 벤치마크를 사용하여 정확도를 75%(기본 모델)에서 80% 이상으로 높였습니다.

Preference Fine-Tuning은 현재 gpt-4o-2024-08-06에 대해 출시 중이며, 곧 gpt-4o-mini-2024-07-18에서도 사용할 수 있게 됩니다.

Go 및 Java용 신규 SDK

OpenAI는 개발자 접근성을 확대하기 위해 Go 및 Java용 베타 SDK를 출시했습니다:

  • Go SDK: API 통합을 위한 전용 라이브러리를 제공합니다.
  • Java SDK: 엔터프라이즈 소프트웨어 개발 환경을 대상으로 API 요청을 관리하기 위한 타입 지정된 요청 및 응답 객체와 유틸리티를 제공합니다.

Sources