Llama 3.2 Vision 現已可在 Ollama 中使用

Llama 3.2 Vision 現在可以透過 Ollama 進行本地執行,提供 11B 和 90B 參數規模的多模態能力。此版本讓使用者能夠在自己的硬體上同時處理圖像和文本。

模型大小與硬體需求

Llama 3.2 Vision 提供兩種主要的配置,以平衡效能與資源可用性:

  • 11B 模型:需要至少 8GB 的 VRAM。
  • 90B 模型:需要至少 64GB 的 VRAM。

多模態能力

Llama 3.2 Vision 支援多種視覺理解任務。展示出的關鍵能力包括:

  • 手寫辨識:模型可以解讀並轉錄手寫文本。
  • 光學字元辨識 (OCR):模型可以從圖像中提取印刷文本。
  • 圖表與表格:模型可以分析並解讀以圖形格式或表格結構呈現的數據。
  • 圖像問答 (Q&A):模型可以根據所提供的圖像視覺內容回答特定問題。

實作與使用方式

要使用 Llama 3.2 Vision,使用者必須安裝 Ollama 0.4。模型可以透過命令列使用 ollama run llama3.2-vision(針對 11B 版本)或 ollama run llama3.2-vision:90b(針對 90B 版本)來拉取並執行。

透過函式庫進行整合

Ollama 提供多種方式將 Llama 3.2 Vision 整合到應用程式中:

  • Python:使用 ollama-python 函式庫,可以在 messages 陣列中使用 images 鍵值來傳遞圖像。
  • JavaScript:使用 ollama-js 函式庫,chat 方法可以在訊息物件中接受圖像路徑或 base64 資料。
  • cURL:API 允許透過 HTTP 請求直接與 http://localhost:11434/api/chat 進行互動,其中圖像以 base64 編碼的資料形式發送。

本地互動

在終端機中,使用者可以透過拖放圖像檔案,或是在 Linux 系統上指定圖像的檔案路徑來將圖像加入提示詞中。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch