Ollama LLaVA 1.6 시각 모델 지원
Ollama는 대규모 언어 및 시각 보조자(Large Language-and-Vision Assistant)인 LLaVA 1.6 모델 컬렉션을 통합하여 사용자에게 향상된 이미지 해상도, 개선된 추론 능력, 더 넓은 모델 크기 범위를 제공합니다. 이 업데이트는 Ollama 생태계 내에서 이미지 분석의 세부 정보를 더 잘 처리하고 텍스트 인식을 향상시킵니다.
LLaVA 1.6 기술적 개선 사항
LLaVA 1.6는 이전 버전에 비해 세 가지 주요 개선 사항을 도입합니다:
- 이미지 해상도 향상: 모델은 최대 4배 더 많은 픽셀을 지원하여 이미지 내 세부 사항을 더 잘 포착하고 해석할 수 있습니다.
- 추론 및 OCR 개선: 문서, 차트, 다이어그램에 특화된 추가 데이터셋으로 훈련되어 텍스트 인식과 논리적 추론 능력이 향상되었습니다.
- 유연한 라이선스: LLaVA 1.6는 Apache 2.0 라이선스 또는 LLaMA 2 커뮤니티 라이선스 하에 배포됩니다.
사용 가능한 모델 크기
Ollama는 성능과 하드웨어 제약을 고려하여 LLaVA 1.6를 세 가지 다른 파라미터 크기로 제공합니다:
- 7B:
ollama run llava:7b - 13B:
ollama run llava:13b - 34B:
ollama run llava:34b(새로운 크기)
구현 및 사용 방법
Ollama의 시각 모델은 명령줄 인터페이스(CLI), Python, 또는 JavaScript를 통해 접근할 수 있습니다.
CLI 통합
사용자는 .jpg 및 .png 형식을 지원하는 이미지 파일을 직접 파일 경로로 명령줄에 전달할 수 있습니다:
ollama run llava "describe this image: ./art.jpg"
프로그래밍 방식 접근
Ollama Python 또는 JavaScript 라이브러리, 또는 REST API를 사용하는 개발자는 이미지를 images 매개변수 내 파일 경로 또는 base64 인코딩된 파일로 제공할 수 있습니다.
Python 예제:
import ollama
res = ollama.chat(
model="llava",
messages=[
{
'role': 'user',
'content': 'Describe this image:',
'images': ['./art.jpg']
}
]
)
print(res['message']['content'])
JavaScript 예제:
import ollama from 'ollama'
const res = await ollama.chat({
model: 'llava',
messages: [{
role: 'user',
content: 'Describe this image:',
images: ['./art.jpg']
}]
})
console.log(res.message.content)
시각 능력 및 활용 사례
LLaVA 1.6는 두 가지 주요 시각 작업에서 뛰어난 성능을 보입니다:
- 객체 탐지: 모델은 주제를 식별하고 그들의 행동 및 감정을 설명할 수 있으며, 예를 들어 VR 게임 장비를 사용하는 사람을 식별하고 그가 경험에 몰입하고 있음을 기록할 수 있습니다.
- 텍스트 인식(OCR): LLaVA 1.6 모델은 이미지 내 볼드체나 스타일화된 텍스트를 정확히 식별할 수 있으며, 예를 들어 고대비 이미지에서 "ollama"라는 단어를 식별할 수 있습니다.
Sources
- OriginalVision models
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch