Ollama에서 Llama 3.2 Vision 사용 가능
Llama 3.2 Vision은 이제 Ollama를 통해 로컬에서 실행할 수 있으며, 11B 및 90B 파라미터 크기로 멀티모달 기능을 제공합니다. 이번 출시를 통해 사용자는 자신의 하드웨어에서 이미지와 텍스트를 동시에 처리할 수 있습니다.
모델 크기 및 하드웨어 요구 사항
Llama 3.2 Vision은 성능과 리소스 가용성 사이의 균형을 맞추기 위해 두 가지 주요 구성으로 제공됩니다:
- 11B 모델: 최소 8GB의 VRAM이 필요합니다.
- 90B 모델: 최소 64GB의 VRAM이 필요합니다.
멀티모달 기능
Llama 3.2 Vision은 다양한 시각적 이해 작업을 지원합니다. 입증된 주요 기능은 다음과 같습니다:
- 필기 인식: 모델은 손으로 쓴 텍스트를 해석하고 전사할 수 있습니다.
- 광학 문자 인식 (OCR): 모델은 이미지에서 인쇄된 텍스트를 추출할 수 있습니다.
- 차트 및 표: 모델은 그래픽 형식이나 표 구조로 제시된 데이터를 분석하고 해석할 수 있습니다.
- 이미지 질의응답 (Q&A): 모델은 제공된 이미지의 시각적 콘텐츠를 기반으로 특정 질문에 답할 수 있습니다.
구현 및 사용법
Llama 3.2 Vision을 사용하려면 Ollama 0.4가 설치되어 있어야 합니다. 모델은 명령줄에서 ollama run llama3.2-vision (11B 버전용) 또는 ollama run llama3.2-vision:90b (90B 버전용)를 사용하여 가져오고 실행할 수 있습니다.
라이브러리를 통한 통합
Ollama는 Llama 3.2 Vision을 애플리케이션에 통합하는 여러 가지 방법을 제공합니다:
- Python:
ollama-python라이브러리를 사용하여,messages배열 내의images키를 통해 이미지를 전달할 수 있습니다. - JavaScript:
ollama-js라이브러리를 사용하여,chat메서드는 메시지 객체 내에서 이미지 경로 또는 base64 데이터를 허용합니다. - cURL: API는
http://localhost:11434/api/chat으로의 HTTP 요청을 통해 직접적인 상호작용을 허용하며, 여기서 이미지는 base64로 인코딩된 데이터로 전송됩니다.
로컬 상호작용
터미널에서 사용자는 이미지 파일을 드래그 앤 드롭하거나 Linux 시스템에서 이미지 파일 경로를 지정하여 프롬프트에 이미지를 추가할 수 있습니다.
Sources
- OriginalLlama 3.2 Vision
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch