Ollama에서 Llama 3.2 Vision 사용 가능

Llama 3.2 Vision은 이제 Ollama를 통해 로컬에서 실행할 수 있으며, 11B 및 90B 파라미터 크기로 멀티모달 기능을 제공합니다. 이번 출시를 통해 사용자는 자신의 하드웨어에서 이미지와 텍스트를 동시에 처리할 수 있습니다.

모델 크기 및 하드웨어 요구 사항

Llama 3.2 Vision은 성능과 리소스 가용성 사이의 균형을 맞추기 위해 두 가지 주요 구성으로 제공됩니다:

  • 11B 모델: 최소 8GB의 VRAM이 필요합니다.
  • 90B 모델: 최소 64GB의 VRAM이 필요합니다.

멀티모달 기능

Llama 3.2 Vision은 다양한 시각적 이해 작업을 지원합니다. 입증된 주요 기능은 다음과 같습니다:

  • 필기 인식: 모델은 손으로 쓴 텍스트를 해석하고 전사할 수 있습니다.
  • 광학 문자 인식 (OCR): 모델은 이미지에서 인쇄된 텍스트를 추출할 수 있습니다.
  • 차트 및 표: 모델은 그래픽 형식이나 표 구조로 제시된 데이터를 분석하고 해석할 수 있습니다.
  • 이미지 질의응답 (Q&A): 모델은 제공된 이미지의 시각적 콘텐츠를 기반으로 특정 질문에 답할 수 있습니다.

구현 및 사용법

Llama 3.2 Vision을 사용하려면 Ollama 0.4가 설치되어 있어야 합니다. 모델은 명령줄에서 ollama run llama3.2-vision (11B 버전용) 또는 ollama run llama3.2-vision:90b (90B 버전용)를 사용하여 가져오고 실행할 수 있습니다.

라이브러리를 통한 통합

Ollama는 Llama 3.2 Vision을 애플리케이션에 통합하는 여러 가지 방법을 제공합니다:

  • Python: ollama-python 라이브러리를 사용하여, messages 배열 내의 images 키를 통해 이미지를 전달할 수 있습니다.
  • JavaScript: ollama-js 라이브러리를 사용하여, chat 메서드는 메시지 객체 내에서 이미지 경로 또는 base64 데이터를 허용합니다.
  • cURL: API는 http://localhost:11434/api/chat으로의 HTTP 요청을 통해 직접적인 상호작용을 허용하며, 여기서 이미지는 base64로 인코딩된 데이터로 전송됩니다.

로컬 상호작용

터미널에서 사용자는 이미지 파일을 드래그 앤 드롭하거나 Linux 시스템에서 이미지 파일 경로를 지정하여 프롬프트에 이미지를 추가할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch