Llama 3.2 Vision 已可在 Ollama 中使用
Llama 3.2 Vision 现在可以通过 Ollama 进行本地执行,提供 11B 和 90B 参数规模的多模态能力。此版本使用户能够在自己的硬件上同时处理图像和文本。
模型规模与硬件要求
Llama 3.2 Vision 提供两种主要配置,以平衡性能和资源可用性:
- 11B 模型:需要至少 8GB 的 VRAM。
- 90B 模型:需要至少 64GB 的 VRAM。
多模态能力
Llama 3.2 Vision 支持多种视觉理解任务。展示出的关键能力包括:
- 手写识别:模型可以解释并转录手写文本。
- 光学字符识别 (OCR):模型可以从图像中提取打印文本。
- 图表与表格:模型可以分析并解释以图形格式或表格结构呈现的数据。
- 图像问答 (Q&A):模型可以根据所提供图像的视觉内容回答特定问题。
实现与使用
要使用 Llama 3.2 Vision,用户必须安装 Ollama 0.4。可以通过命令行使用 ollama run llama3.2-vision(针对 11B 版本)或 ollama run llama3.2-vision:90b(针对 90B 版本)来拉取并执行模型。
通过库进行集成
Ollama 提供了多种方式将 Llama 3.2 Vision 集成到应用程序中:
- Python:使用
ollama-python库,可以在messages数组中使用images键传递图像。 - JavaScript:使用
ollama-js库,chat方法在消息对象中接受图像路径或 base64 数据。 - cURL:API 允许通过向
http://localhost:11434/api/chat发送 HTTP 请求进行直接交互,其中图像作为 base64 编码的数据发送。
本地交互
在终端中,用户可以通过拖放图像文件,或在 Linux 系统上指定图像的文件路径来将图像添加到提示词中。
Sources
- OriginalLlama 3.2 Vision
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch