Llama 3.2 Vision 已可在 Ollama 中使用

Llama 3.2 Vision 现在可以通过 Ollama 进行本地执行,提供 11B 和 90B 参数规模的多模态能力。此版本使用户能够在自己的硬件上同时处理图像和文本。

模型规模与硬件要求

Llama 3.2 Vision 提供两种主要配置,以平衡性能和资源可用性:

  • 11B 模型:需要至少 8GB 的 VRAM。
  • 90B 模型:需要至少 64GB 的 VRAM。

多模态能力

Llama 3.2 Vision 支持多种视觉理解任务。展示出的关键能力包括:

  • 手写识别:模型可以解释并转录手写文本。
  • 光学字符识别 (OCR):模型可以从图像中提取打印文本。
  • 图表与表格:模型可以分析并解释以图形格式或表格结构呈现的数据。
  • 图像问答 (Q&A):模型可以根据所提供图像的视觉内容回答特定问题。

实现与使用

要使用 Llama 3.2 Vision,用户必须安装 Ollama 0.4。可以通过命令行使用 ollama run llama3.2-vision(针对 11B 版本)或 ollama run llama3.2-vision:90b(针对 90B 版本)来拉取并执行模型。

通过库进行集成

Ollama 提供了多种方式将 Llama 3.2 Vision 集成到应用程序中:

  • Python:使用 ollama-python 库,可以在 messages 数组中使用 images 键传递图像。
  • JavaScript:使用 ollama-js 库,chat 方法在消息对象中接受图像路径或 base64 数据。
  • cURL:API 允许通过向 http://localhost:11434/api/chat 发送 HTTP 请求进行直接交互,其中图像作为 base64 编码的数据发送。

本地交互

在终端中,用户可以通过拖放图像文件,或在 Linux 系统上指定图像的文件路径来将图像添加到提示词中。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch