GPT-4o 비전 파인튜닝 API 출시
OpenAI는 GPT-4o에 대한 비전 파인튜닝을 도입하여 개발자들이 이미지와 텍스트를 모두 사용해 모델을 맞춤화할 수 있게 했습니다. 이 기능은 텍스트만으로는 충분하지 않은 특화된 시각 작업, 예를 들어 향상된 시각 검색, 자율주행 차량 객체 탐지, 의료 이미지 분석 등에서 큰 개선을 가능하게 합니다.
비전 파인튜닝의 기술 구현
GPT-4o의 비전 파인튜닝은 텍스트 기반 파인튜닝과 유사한 절차를 따릅니다. 개발자들은 특정 형식의 이미지 데이터셋을 준비하고 이를 OpenAI 플랫폼에 업로드합니다.
주요 기술 세부 사항은 다음과 같습니다:
- Data Requirements: 성능 향상은 최소 100장의 이미지만으로도 달성할 수 있지만, 더 많은 텍스트와 이미지 데이터가 있으면 성능을 더욱 높일 수 있습니다.
- Model Support: 이 기능은
gpt-4o-2024-08-06모델 스냅샷에서 지원됩니다. - Input Format: 데이터셋은 메시지에 텍스트와
image_url유형을 모두 포함할 수 있는 JSON 구조를 사용하며, 이는 OpenAI의 Chat 엔드포인트에서 사용되는 형식을 그대로 따릅니다.
실제 성능 향상
초기 파트너와의 협업을 통해 비전 파인튜닝이 기본 GPT-4o 모델에 비해 다양한 분야에서 상당한 성능 향상을 제공한다는 것이 입증되었습니다.
매핑 및 인프라 (Grab)
Grab은 100개의 예시를 사용해 GPT-4o가 교통 표지판을 위치 파악하고 차선 구분선을 세는 방법을 학습시켰습니다. 그 결과:
- 차선 개수 정확도가 20% 향상되었습니다.
- 제한 속도 표지판 위치 파악이 13% 향상되었습니다.
엔터프라이즈 자동화 (Automat)
Automat은 스크린샷과 비정형 문서를 활용해 RPA(로보틱 프로세스 자동화) 에이전트를 개선했습니다:
- UI Element Localization: 모델을 자연어 설명을 통해 UI 요소를 찾도록 학습시킴으로써 성공률이 16.60%에서 61.67%로 상승했습니다(272% 향상).
- Information Extraction: 비정형 보험 문서 200장의 이미지로 학습시켜 F1 점수가 7% 상승했습니다.
디지털 콘텐츠 제작 (Coframe)
Coframe은 이미지와 코드를 사용해 GPT-4o를 파인튜닝하여 브랜드 웹사이트 섹션을 생성했습니다. 이 방법은 모델이 일관된 시각 스타일과 올바른 레이아웃을 유지하는 능력을 기본 모델에 비해 26% 향상시켰습니다.
안전성, 프라이버시 및 데이터 제어
비전 파인튜닝은 OpenAI의 엔터프라이즈 프라이버시 약속에 따라 관리됩니다. 주요 보호 조치는 다음과 같습니다:
- Data Ownership: 파인튜닝된 모델은 개발자의 통제 하에 유지되며, 개발자는 자신의 비즈니스 데이터에 대한 완전한 소유권을 유지합니다.
- Training Restrictions: OpenAI는 명시적인 허가 없이 비전 파인튜닝 서비스에 사용된 입력 또는 출력 데이터를 기반으로 기본 모델을 학습시키지 않습니다.
- Monitoring: OpenAI는 자동화된 안전 평가를 수행하고 사용을 모니터링하여 사용 정책 준수를 보장합니다.
이용 가능 여부 및 가격
비전 파인튜닝은 유료 사용 티어에 있는 모든 개발자에게 제공됩니다.
가격 구조 (2024년 10월 31일 이후)
- Training: 1M 토큰당 $25.
- Inference (Input): 1M 토큰당 $3.75.
- Inference (Output): 1M 토큰당 $15.
이미지 입력은 이미지 크기에 따라 토큰화되며 텍스트 입력과 동일한 토큰당 요금이 적용됩니다. OpenAI는 2024년 10월 31일까지 하루에 1M 무료 학습 토큰을 제공했음을 참고하십시오.