QVQ-Max 시각 추론 모델 출시

수학 정확도를 위한 사고 과정 확장

QVQ-Max는 내부 사고 과정의 길이와 MathVision 벤치마크에서의 정확도 사이에 직접적인 상관관계가 있음을 보여줍니다. 모델의 사고 과정 최대 길이를 조정함으로써 Qwen은 정확도가 지속적으로 향상되는 것을 관찰했으며, 이는 모델의 추론 능력이 "사고"에 할당된 계산 예산에 따라 확장된다는 것을 의미합니다.

핵심 기술 역량

QVQ-Max는 "날카로운 눈"과 "빠른 사고"를 겸비한 어시스턴트로 설계되었으며, 세 가지 주요 기능 영역에 초점을 맞춥니다:

상세 관찰

QVQ-Max는 차트와 일상 스냅샷을 포함한 복잡한 시각 입력을 분석하여 핵심 요소, 텍스트 라벨 및 표준 모델이 간과할 수 있는 미세한 디테일을 식별합니다.

심층 추론

이 모델은 시각 관찰과 배경 지식을 결합하여 결론을 도출합니다. 여기에는 도형을 기반으로 한 기하학 문제 해결 및 현재 장면을 기반으로 비디오 클립에서 미래 사건을 예측하는 것이 포함됩니다.

유연한 적용

분석을 넘어 QVQ-Max는 창의적이고 실용적인 작업에 추론을 적용합니다, 예를 들어:

  • 거친 스케치를 완전한 일러스트레이션으로 다듬기.
  • 짧은 비디오 스크립트 생성.
  • 롤플레잉 콘텐츠 제작.
  • 업로드된 사진에 대한 비평이나 해석 제공.

실용 적용 시나리오

QVQ-Max는 세 가지 주요 분야에서 활용되도록 설계되었습니다:

  • 업무 환경: 데이터 분석, 정보 조직 및 코드 생성 지원.
  • 교육: 도표에 의존하는 복잡한 수학 및 물리 문제 해결과 직관적인 개념 설명.
  • 일상 생활: 옷장 사진을 통한 의상 조합 추천이나 이미지 기반 레시피 안내 등 실용적인 조언 제공.

향후 개발 로드맵

Qwen은 QVQ-Max의 발전을 위한 세 가지 주요 영역을 확인했습니다:

  1. 향상된 관찰 정확도: 시각 관찰을 검증하기 위한 그라운딩 기법 구현.
  2. 시각 에이전트 역량: 컴퓨터, 스마트폰 운영 및 게임 플레이 등 다단계 복합 작업 수행 능력 향상.
  3. 다중모달 상호작용: 텍스트를 넘어 도구 검증 및 시각 생성 등을 포함하도록 상호작용 확대.

Sources