OpenAI GPT-5.6 Sol 시각 인식 능력 및 벤치마크
GPT-5.6 Sol은 OpenAI의 시각 이해 능력을 크게 향상시킴
OpenAI의 GPT-5.6 라인업—Sol, Terra, Luna—은 특히 객체 탐지 및 카운팅 측면에서 시각 인식 능력에서 큰 도약을 이뤘다. GPT-5.6 Sol은 OpenAI가 현재까지 출시한 가장 강력한 시각 모델이지만, 비용, 지연 시간, 원시 탐지 정확도 측면에서 Gemini 3.5 Flash와 치열한 경쟁을 벌이고 있다.
객체 탐지 및 카운팅에서의 큰 성과
GPT-5.6 Sol은 객체 탐지의 주요 약점을 실용적인 기능으로 전환했다. Roboflow의 벤치마크에서 Sol은 13.8에서 46.2 mAP@50로 급격히 향상되었으며, Terra와 Luna는 각각 44.7과 43.3을 기록했다.
주요 탐지 강점
- 문서 레이아웃: 제목, 단락, 표, 이미지, 서명 등을 정확히 식별하여 문서 워크플로우를 용이하게 한다.
- 밀도 높은 장면: 이전 버전보다 많은 유사한 물체가 서로 가까이 밀집된 장면(예: 알약 또는 달걀)을 더 효과적으로 처리한다.
- 좌표 프롬프트: 성능은 프롬프트 형식에 매우 민감하다. GPT-5.6 모델은 이미지 픽셀 단위의 절대 XYXY 좌표를 요청할 때 가장 우수한 성능을 보이며, 잘못된 형식을 사용하면 성능이 약 15 mAP 포인트 감소할 수 있다.
카운팅 정확도
전체 라인업에서 카운팅 성능이 향상되었다. Sol은 GPT-5.5의 64.9%에서 73.0%로 상승했다. 모델은 겹치는 객체를 카운팅하고 특정 영역(예: 점수 영역 내의 탄환 구멍만 세기)에 대해 카운팅 규칙을 적용하는 능력을 보였다.
OCR 및 데이터 추출 성능
OCR 성능은 GPT-5.5와 비교해 비교적 안정적이었다. Sol은 90.7%의 평균 유사도 점수를 기록했으며, GPT-5.5의 91.2%보다 약간 낮았다. 텍스트 추출에서는 Sol이 82.5%를 기록했고, GPT-5.5는 87.6%였다.
원시 점수의 약간의 하락에도 불구하고 Sol은 복잡한 시나리오에서 높은 활용도를 보였다:
- 손글씨 텍스트: 손글씨 노트에서 전체 번역을 성공적으로 생성하고 특정 날짜를 추출했다.
- 임베디드 텍스트: 휘어진 더러운 표면에 있는 타이어 크기 시퀀스를 읽고 스포츠 방송에서 실시간 스코어를 추출했다.
- 실패 지점: 반사로 인해 영향을 받는 작은, 세로형, 저대비 텍스트(예: 블리스터 팩의 유효기간)는 여전히 도전 과제다.
운영적 트레이드오프: 비용, 지연 시간, 안정성
시각 인식 능력의 향상은 토큰 사용량 증가와 더 높은 운영 비용을 수반한다.
| 모델 | 이미지당 평균 시간 | 이미지당 평균 비용 |
|---|---|---|
| GPT-5.6 Sol | ~10초 | ~$0.025 |
| GPT-5.6 Terra | ~6초 | ~$0.01 |
| GPT-5.6 Luna | ~5초 | <$0.005 |
| Gemini 3.5 Flash | N/A | ~$0.008 |
안정성 문제
OpenAI는 Sol이 2,000 x 2,000 픽셀 이상의 이미지에서 안정성이 떨어진다는 점을 확인했다. 더 높은 추론 노력은 안정성을 개선할 수 있지만, 비용과 지연 시간을 증가시킨다. 권장되는 대안은 API 제출 전 이미지를 리사이즈하거나 자르는 것이다.
커뮤니티의 통찰과 반론
벤치마크 데이터는 진전을 보여주지만, 커뮤니티 논의는 이러한 모델의 실용적 적용에 대해 몇 가지 중요한 시각을 제시한다.
경쟁적 위치
여러 사용자가 Gemini 3.5 Flash가 탐지 및 카운팅에서 Sol을 능가하면서도 훨씬 저렴하다고 지적했다. 한 사용자는 다음과 같이 지적했다:
GPT 5.6 Sol은 OCR을 제외한 모든 벤치마크에서 Gemini 3.5 Flash에 밀렸으며, 단 하나의 예외(OCR)에서는 Fable이 승리했다. Gemini 3.5 Flash는 GPT 5.6 Sol을 능가했을 뿐만 아니라 비용의 1/3로 이를 달성했다.
전문적 사용 사례
일부 사용자는 일반 벤치마크가 가치를 포착하지 못하는 특수 분야에서 성공을 보고했다:
- UI/UX 분석: 한 사용자는 Sol이 Claude보다 비표준 UI 블록을 식별하고 페이지를 재구성하여 조합 가능한 단위로 나누는 데 더 우수하다고 평가했다.
- 영상 자막 생성: 한 사용자는 Sol이 현재까지 가장 우수한 영상 자막 생성 모델이며, 특히 복잡한 밀리초 단위의 움직임을 정확히 자막화하는 데 최적이라고 주장했다.
- 특수 전사: 한 사용자는 Sol이 시트 음악을 성공적으로 전사했다고 보고했는데, 이는 일반적으로 대부분의 시각 모델이 어려워하는 작업이다.
기술적 회의론
일부 개발자는 시연된 많은 작업(예: 알약 카운팅)이 전통적인 컴퓨터 비전 도구로 더 잘 처리될 수 있다고 주장했다. 한 사용자는 다음과 같이 지적했다:
아이러니하게도, "최고의 시각 모델"을 보여주기 위해 선택된 알약 카운팅 예제는 OpenCV 템플릿 매칭을 통해 쉽게 해결할 수 있다. 이 기술은 25년 전에 개발된 것이다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch