Ollama LLaVA 1.6 Vision Model Support

Ollama 已整合 LLaVA (Large Language-and-Vision Assistant) 1.6 模型系列,為使用者提供更高的影像解析度、更強的推理能力以及更廣泛的模型尺寸選擇。此更新讓 Ollama 生態系統內能進行更詳細的影像分析與更好的文字辨識。

LLaVA 1.6 技術增強

LLaVA 1.6 相比於先前版本引入了三項主要改進:

  • Increased Image Resolution: 模型現在支援高達 4 倍的像素,使助手能夠捕捉並解讀影像中的細微細節。
  • Enhanced Reasoning and OCR: 模型已針對文件、圖表和圖解進行額外數據集的訓練,以提升文字辨識與邏輯推理能力。
  • Permissive Licensing: LLaVA 1.6 是根據 Apache 2.0 授權或 LLaMA 2 Community License 發佈。

Available Model Sizes

Ollama 提供三種不同參數規模的 LLaVA 1.6,以平衡效能與硬體限制:

  • 7B: ollama run llava:7b
  • 13B: ollama run llava:13b
  • 34B: ollama run llava:34b (新尺寸)

Implementation and Usage

Ollama 中的視覺模型可以透過命令列介面 (CLI)、Python 或 JavaScript 進行介接。

CLI Integration

使用者可以直接在命令列中將影像檔案(支援 .jpg.png 格式)作為檔案路徑傳遞:

ollama run llava "describe this image: ./art.jpg"

Programmatic Access

對於使用 Ollama Python 或 JavaScript 函式庫,或 REST API 的開發者,影像可以作為檔案路徑,或作為聊天請求中 images 參數內的 base64 編碼檔案提供。

Python Example:

import ollama

res = ollama.chat(
	model="llava",
	messages=[
		{
			'role': 'user',
			'content': 'Describe this image:',
			'images': ['./art.jpg']
		}
		]
)

print(res['message']['content'])

JavaScript Example:

import ollama from 'ollama'

const res = await ollama.chat({
	model: 'llava',
	messages: [{
		role: 'user',
		content: 'Describe this image:'
		images: ['./art.jpg']
	}]
})

console.log(res.message.content)

Vision Capabilities and Use Cases

LLaVA 1.6 在兩項主要視覺任務中展現了卓越的表現:

  • Object Detection: 模型可以識別主體並描述其動作與情緒,例如識別出正在使用 VR 遊戲設備的人,並指出其沉浸於體驗中的狀態。
  • Text Recognition (OCR): LLaVA 1.6 模型可以準確識別影像中的粗體或風格化文字,例如在一個高對比度的影像中識別出 "ollama" 這個單字。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch