Ollama LLaVA 1.6 Vision Model Support
Ollama 已整合 LLaVA (Large Language-and-Vision Assistant) 1.6 模型系列,為使用者提供更高的影像解析度、更強的推理能力以及更廣泛的模型尺寸選擇。此更新讓 Ollama 生態系統內能進行更詳細的影像分析與更好的文字辨識。
LLaVA 1.6 技術增強
LLaVA 1.6 相比於先前版本引入了三項主要改進:
- Increased Image Resolution: 模型現在支援高達 4 倍的像素,使助手能夠捕捉並解讀影像中的細微細節。
- Enhanced Reasoning and OCR: 模型已針對文件、圖表和圖解進行額外數據集的訓練,以提升文字辨識與邏輯推理能力。
- Permissive Licensing: LLaVA 1.6 是根據 Apache 2.0 授權或 LLaMA 2 Community License 發佈。
Available Model Sizes
Ollama 提供三種不同參數規模的 LLaVA 1.6,以平衡效能與硬體限制:
- 7B:
ollama run llava:7b - 13B:
ollama run llava:13b - 34B:
ollama run llava:34b(新尺寸)
Implementation and Usage
Ollama 中的視覺模型可以透過命令列介面 (CLI)、Python 或 JavaScript 進行介接。
CLI Integration
使用者可以直接在命令列中將影像檔案(支援 .jpg 和 .png 格式)作為檔案路徑傳遞:
ollama run llava "describe this image: ./art.jpg"
Programmatic Access
對於使用 Ollama Python 或 JavaScript 函式庫,或 REST API 的開發者,影像可以作為檔案路徑,或作為聊天請求中 images 參數內的 base64 編碼檔案提供。
Python Example:
import ollama
res = ollama.chat(
model="llava",
messages=[
{
'role': 'user',
'content': 'Describe this image:',
'images': ['./art.jpg']
}
]
)
print(res['message']['content'])
JavaScript Example:
import ollama from 'ollama'
const res = await ollama.chat({
model: 'llava',
messages: [{
role: 'user',
content: 'Describe this image:'
images: ['./art.jpg']
}]
})
console.log(res.message.content)
Vision Capabilities and Use Cases
LLaVA 1.6 在兩項主要視覺任務中展現了卓越的表現:
- Object Detection: 模型可以識別主體並描述其動作與情緒,例如識別出正在使用 VR 遊戲設備的人,並指出其沉浸於體驗中的狀態。
- Text Recognition (OCR): LLaVA 1.6 模型可以準確識別影像中的粗體或風格化文字,例如在一個高對比度的影像中識別出 "ollama" 這個單字。
Sources
- OriginalVision models
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch