Ollama LLaVA 1.6 시각 모델 지원

Ollama는 대규모 언어 및 시각 보조자(Large Language-and-Vision Assistant)인 LLaVA 1.6 모델 컬렉션을 통합하여 사용자에게 향상된 이미지 해상도, 개선된 추론 능력, 더 넓은 모델 크기 범위를 제공합니다. 이 업데이트는 Ollama 생태계 내에서 이미지 분석의 세부 정보를 더 잘 처리하고 텍스트 인식을 향상시킵니다.

LLaVA 1.6 기술적 개선 사항

LLaVA 1.6는 이전 버전에 비해 세 가지 주요 개선 사항을 도입합니다:

  • 이미지 해상도 향상: 모델은 최대 4배 더 많은 픽셀을 지원하여 이미지 내 세부 사항을 더 잘 포착하고 해석할 수 있습니다.
  • 추론 및 OCR 개선: 문서, 차트, 다이어그램에 특화된 추가 데이터셋으로 훈련되어 텍스트 인식과 논리적 추론 능력이 향상되었습니다.
  • 유연한 라이선스: LLaVA 1.6는 Apache 2.0 라이선스 또는 LLaMA 2 커뮤니티 라이선스 하에 배포됩니다.

사용 가능한 모델 크기

Ollama는 성능과 하드웨어 제약을 고려하여 LLaVA 1.6를 세 가지 다른 파라미터 크기로 제공합니다:

  • 7B: ollama run llava:7b
  • 13B: ollama run llava:13b
  • 34B: ollama run llava:34b (새로운 크기)

구현 및 사용 방법

Ollama의 시각 모델은 명령줄 인터페이스(CLI), Python, 또는 JavaScript를 통해 접근할 수 있습니다.

CLI 통합

사용자는 .jpg.png 형식을 지원하는 이미지 파일을 직접 파일 경로로 명령줄에 전달할 수 있습니다:

ollama run llava "describe this image: ./art.jpg"

프로그래밍 방식 접근

Ollama Python 또는 JavaScript 라이브러리, 또는 REST API를 사용하는 개발자는 이미지를 images 매개변수 내 파일 경로 또는 base64 인코딩된 파일로 제공할 수 있습니다.

Python 예제:

import ollama

res = ollama.chat(
    model="llava",
    messages=[
        {
            'role': 'user',
            'content': 'Describe this image:',
            'images': ['./art.jpg']
        }
    ]
)

print(res['message']['content'])

JavaScript 예제:

import ollama from 'ollama'

const res = await ollama.chat({
    model: 'llava',
    messages: [{
        role: 'user',
        content: 'Describe this image:',
        images: ['./art.jpg']
    }]
})

console.log(res.message.content)

시각 능력 및 활용 사례

LLaVA 1.6는 두 가지 주요 시각 작업에서 뛰어난 성능을 보입니다:

  • 객체 탐지: 모델은 주제를 식별하고 그들의 행동 및 감정을 설명할 수 있으며, 예를 들어 VR 게임 장비를 사용하는 사람을 식별하고 그가 경험에 몰입하고 있음을 기록할 수 있습니다.
  • 텍스트 인식(OCR): LLaVA 1.6 모델은 이미지 내 볼드체나 스타일화된 텍스트를 정확히 식별할 수 있으며, 예를 들어 고대비 이미지에서 "ollama"라는 단어를 식별할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch