Ollama LLaVA 1.6 视觉模型支持
Ollama 已集成 LLaVA (Large Language-and-Vision Assistant) 1.6 模型系列,为用户提供更高的图像分辨率、更强的推理能力以及更广泛的模型尺寸选择。此次更新允许在 Ollama 生态系统中进行更详细的图像分析和更好的文本识别。
LLaVA 1.6 技术增强
LLaVA 1.6 相比之前的版本引入了三个主要改进:
- 提高图像分辨率: 模型现在支持高达 4 倍的像素量,使助手能够捕捉并解释图像中更细微的细节。
- 增强的推理与 OCR: 模型在专门针对文档、图表和图解的额外数据集上进行了训练,以提高文本识别和逻辑推理能力。
- 宽松的许可协议: LLaVA 1.6 根据 Apache 2.0 许可或 LLaMA 2 Community License 分发。
可用的模型尺寸
Ollama 提供三种不同参数规模的 LLaVA 1.6 模型,以平衡性能和硬件限制:
- 7B:
ollama run llava:7b - 13B:
ollama run llava:13b - 34B:
ollama run llava:34b(新尺寸)
实现与使用
Ollama 中的视觉模型可以通过命令行界面 (CLI)、Python 或 JavaScript 进行交互。
CLI 集成
用户可以直接在命令行中将图像文件(支持 .jpg 和 .png 格式)作为文件路径传递:
ollama run llava "describe this image: ./art.jpg"
程序化访问
对于使用 Ollama Python 或 JavaScript 库或 REST API 的开发者,图像可以通过文件路径或作为聊天请求中 images 参数内的 base64 编码文件提供。
Python 示例:
import ollama
res = ollama.chat(
model="llava",
messages=[
{
'role': 'user',
'content': 'Describe this image:',
'images': ['./art.jpg']
}
]
)
print(res['message']['content'])
JavaScript 示例:
import ollama from 'ollama'
const res = await ollama.chat({
model: 'llava',
messages: [{
role: 'user',
content: 'Describe this image:'
images: ['./art.jpg']
}]
})
console.log(res.message.content)
视觉能力与使用场景
LLaVA 1.6 在两项主要视觉任务中表现出色:
- 目标检测: 模型可以识别主体并描述其动作和情感,例如识别正在使用 VR 游戏设备的人,并注意到他们沉浸在体验中。
- 文本识别 (OCR): LLaVA 1.6 模型可以准确识别图像中加粗或艺术化的文本,例如在对比度高的图像中识别出“ollama”这个词。
Sources
- OriginalVision models
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch