OpenAI o3 및 o4-mini 시각적 추론 출시

OpenAI o3와 o4-mini는 모델이 "이미지와 함께 생각"할 수 있는 능력을 도입했습니다. 즉, 이제 모델은 복잡한 시각적 문제를 해결하기 위해 내부 체인 오브 생각 안에서 이미지 자르기, 확대, 회전과 같은 이미지 조작을 수행할 수 있습니다. 이는 단순히 이미지를 보는 모델에서 멀티모달 에이전시 접근 방식을 사용해 이미지를 적극적으로 추론할 수 있는 모델로의 전환을 의미합니다.

체인 오브 생각 내에서의 네이티브 이미지 조작

OpenAI o3와 o4-mini는 시각 도구를 네이티브하게 통합함으로써 o-시리즈의 장기 내부 추론 능력을 확장합니다. 이전 멀티모달 모델과 달리, 이 모델들은 이미지 처리를 위한 별도의 특화 모델에 의존하지 않으며, 대신 추론 과정 중에 사용자 업로드 이미지에 다음 기술들을 자동으로 적용할 수 있습니다:

  • 확대 및 자르기: 이미지의 특정 영역에 집중하여 더 세밀한 디테일을 추출하거나 작은 텍스트를 읽습니다.
  • 회전 및 뒤집기: 이미지의 방향을 교정하여(예: 뒤집힌 텍스트를 회전) 읽을 수 있게 합니다.
  • 향상: 간단한 이미지 처리 기술을 적용하여 선명도를 개선합니다.

이 기능을 통해 모델은 위치가 부정확하거나 뒤집힌 텍스트가 있거나 하나의 프레임에 여러 문제가 있는 등 불완전한 사진을 다룰 수 있으며, 최종 답변에 도달하기 전에 데이터를 반복적으로 재구성하여 시야를 개선합니다.

멀티모달 에이전시 기능

시각적 추론을 다른 도구와 결합함으로써 o3와 o4-mini는 멀티모달 에이전시 경험을 제공합니다. 모델은 내부 이미지 조작을 웹 검색 및 파이썬 데이터 분석과 같은 외부 도구와 결합하여 고복잡도 작업을 해결할 수 있습니다.

예시:

  • 문서 분석: 텍스트를 회전하고 확대하여 노트북의 손글씨를 읽습니다.
  • 복합 문제 해결: 파이썬을 사용해 알파 채널과 픽셀 값을 분석하고 유효한 경로를 그려 미로를 해결합니다.
  • 기술 문제 해결: 빌드 오류 스크린샷에 대한 근본 원인 분석을 수행합니다.
  • 교육 지원: 사진으로 업로드된 경제학 문제 세트에 대해 단계별 설명을 제공합니다.

벤치마크 성능 및 스케일링

"이미지와 함께 생각"을 도입함으로써 테스트 시점 연산 스케일링을 위한 새로운 축이 생겼으며, 시각적 및 텍스트 추론을 결합합니다. 높은 "추론 노력" 설정에서 평가될 때, o3와 o4-mini는 모든 테스트된 작업에서 이전 멀티모달 모델보다 크게 앞섭니다.

주요 성과:

  • 최첨단(SOTA) 결과: 모델은 STEM 질문 응답(MMMU, MathVista), 차트 읽기 및 추론(CharXiv), 인식 기본 요소(VLMs are Blind), 시각 검색(V*)에서 최첨단 성능을 달성했습니다.
  • 시각 검색 마스터리: V* 벤치마크에서 시각적 추론 접근법은 95.7% 정확도를 달성하여 벤치마크를 대부분 해결했습니다.

현재 제한 사항

진보에도 불구하고, OpenAI는 현재 시각적 추론 구현에서 세 가지 주요 제한 사항을 확인했습니다.

  1. 비효율적인 추론 체인: 모델이 중복된 도구 호출이나 불필요한 이미지 조작을 수행하여 지나치게 긴 체인 오브 생각을 만들 수 있습니다.
  2. 인식 오류: 기본적인 인식 실수가 여전히 발생할 수 있습니다; 모델이 도구를 사용해 올바르게 확대했더라도 결과 시각 데이터를 오해할 수 있습니다.
  3. 신뢰성 문제: 모델이 동일한 문제에 대해 여러 시도에서 서로 다른 시각적 추론 경로를 사용하여 일관되지 않은 결과를 초래할 수 있습니다.

OpenAI는 현재 이러한 모델들을 보다 간결하고 신뢰할 수 있게 멀티모달 추론 과정에서 개선하고 있습니다.

SUMMARY: OpenAI는 o-시리즈 최초 모델인 o3와 o4-mini를 소개했으며, 이 모델들은 고급 시각적 추론을 위해 이미지 조작 도구를 내부 체인 오브 생각에 직접 통합할 수 있습니다.

TITLE: OpenAI o3 및 o4-mini 시각적 추론 출시

Sources