Llama 3.2 Vision 現已可在 Ollama 中使用
Llama 3.2 Vision 現在可以透過 Ollama 進行本地執行,提供 11B 和 90B 參數規模的多模態能力。此版本讓使用者能夠在自己的硬體上同時處理圖像和文本。
模型大小與硬體需求
Llama 3.2 Vision 提供兩種主要的配置,以平衡效能與資源可用性:
- 11B 模型:需要至少 8GB 的 VRAM。
- 90B 模型:需要至少 64GB 的 VRAM。
多模態能力
Llama 3.2 Vision 支援多種視覺理解任務。展示出的關鍵能力包括:
- 手寫辨識:模型可以解讀並轉錄手寫文本。
- 光學字元辨識 (OCR):模型可以從圖像中提取印刷文本。
- 圖表與表格:模型可以分析並解讀以圖形格式或表格結構呈現的數據。
- 圖像問答 (Q&A):模型可以根據所提供的圖像視覺內容回答特定問題。
實作與使用方式
要使用 Llama 3.2 Vision,使用者必須安裝 Ollama 0.4。模型可以透過命令列使用 ollama run llama3.2-vision(針對 11B 版本)或 ollama run llama3.2-vision:90b(針對 90B 版本)來拉取並執行。
透過函式庫進行整合
Ollama 提供多種方式將 Llama 3.2 Vision 整合到應用程式中:
- Python:使用
ollama-python函式庫,可以在messages陣列中使用images鍵值來傳遞圖像。 - JavaScript:使用
ollama-js函式庫,chat方法可以在訊息物件中接受圖像路徑或 base64 資料。 - cURL:API 允許透過 HTTP 請求直接與
http://localhost:11434/api/chat進行互動,其中圖像以 base64 編碼的資料形式發送。
本地互動
在終端機中,使用者可以透過拖放圖像檔案,或是在 Linux 系統上指定圖像的檔案路徑來將圖像加入提示詞中。
Sources
- OriginalLlama 3.2 Vision
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch