Ollama LLaVA 1.6 视觉模型支持

Ollama 已集成 LLaVA (Large Language-and-Vision Assistant) 1.6 模型系列,为用户提供更高的图像分辨率、更强的推理能力以及更广泛的模型尺寸选择。此次更新允许在 Ollama 生态系统中进行更详细的图像分析和更好的文本识别。

LLaVA 1.6 技术增强

LLaVA 1.6 相比之前的版本引入了三个主要改进:

  • 提高图像分辨率: 模型现在支持高达 4 倍的像素量,使助手能够捕捉并解释图像中更细微的细节。
  • 增强的推理与 OCR: 模型在专门针对文档、图表和图解的额外数据集上进行了训练,以提高文本识别和逻辑推理能力。
  • 宽松的许可协议: LLaVA 1.6 根据 Apache 2.0 许可或 LLaMA 2 Community License 分发。

可用的模型尺寸

Ollama 提供三种不同参数规模的 LLaVA 1.6 模型,以平衡性能和硬件限制:

  • 7B: ollama run llava:7b
  • 13B: ollama run llava:13b
  • 34B: ollama run llava:34b (新尺寸)

实现与使用

Ollama 中的视觉模型可以通过命令行界面 (CLI)、Python 或 JavaScript 进行交互。

CLI 集成

用户可以直接在命令行中将图像文件(支持 .jpg.png 格式)作为文件路径传递:

ollama run llava "describe this image: ./art.jpg"

程序化访问

对于使用 Ollama Python 或 JavaScript 库或 REST API 的开发者,图像可以通过文件路径或作为聊天请求中 images 参数内的 base64 编码文件提供。

Python 示例:

import ollama

res = ollama.chat(
	model="llava",
	messages=[
		{
			'role': 'user',
			'content': 'Describe this image:',
			'images': ['./art.jpg']
		}
		]
)

print(res['message']['content'])

JavaScript 示例:

import ollama from 'ollama'

const res = await ollama.chat({
	model: 'llava',
	messages: [{
		role: 'user',
		content: 'Describe this image:'
		images: ['./art.jpg']
	}]
})

console.log(res.message.content)

视觉能力与使用场景

LLaVA 1.6 在两项主要视觉任务中表现出色:

  • 目标检测: 模型可以识别主体并描述其动作和情感,例如识别正在使用 VR 游戏设备的人,并注意到他们沉浸在体验中。
  • 文本识别 (OCR): LLaVA 1.6 模型可以准确识别图像中加粗或艺术化的文本,例如在对比度高的图像中识别出“ollama”这个词。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch