Ollama 多模態引擎發佈

Ollama 已推出全新的多模態引擎,旨在讓視覺模型成為其生態系統中的一等公民。此次更新提升了本地推論的可靠性與準確性,並為未來支援語音、圖像生成、影片生成以及擴展工具支援等模態奠定了基礎。

支援的多模態模型

Ollama 的新引擎可實現多個高效能視覺模型的本地執行,包括:

  • Meta Llama 4 (包含 109B 參數的 Mixture-of-Experts 模型,Llama 4 Scout)
  • Google Gemma 3
  • Qwen 2.5 VL
  • Mistral Small 3.1

關鍵技術能力

通用理解與推理

新引擎支援複雜的視覺推理與多圖分析。例如,Llama 4 Scout 可以分析影片影格以識別地點(例如舊金山的 Ferry Building),並提供基於位置的推理,例如計算與其他地標的距離。

Gemma 3 支援多圖輸入,允許使用者同時輸入多張圖片或透過後續提示詞來識別圖片間的共同元素,或推理不同視覺主體之間的關係。

文件掃描與 OCR

Qwen 2.5 VL 被用於高準確度的字元識別與文件掃描。這包括理解並將垂直排列的中文春聯翻譯成英文的能力。

架構改進

模型模組化

為了提升可靠性並簡化整合,Ollama 已轉向自包含的模型架構。先前,依賴 ggml/llama.cpp 意味著文本解碼器與視覺編碼器被拆分為獨立執行的不同模型,需要在編排層中加入模型特定的邏輯。

在新引擎中,每個模型都是完全自包含的,並根據其訓練內容提供對齊的投影層 (projection layer)。這種隔離機制防止了需要修補多個檔案或使用級聯 if 語句的需求,讓模型開發者能夠實施其程式碼,而不會冒險於其他模型的退化問題。

推論準確性

Ollama 已實施元數據 (metadata) 處理來處理會產生大量 token 的大型圖像。透過管理因果注意力 (causal attention) 並確定將圖像嵌入 (embeddings) 切分為批次 (batches) 的最佳邊界,Ollama 確保圖像處理遵循模型的原始設計與訓練,防止因圖像切分錯誤而導致的輸出品質下降。

記憶體管理與優化

Ollama 引入了多項針對記憶體的特定優化,以提升效能並降低資源消耗:

  • 圖像快取 (Image Caching): 處理過的圖像會被快取以加速後續提示詞,並在被使用期間持續保留在快取中。
  • 硬體整合: Ollama 與硬體製造商 (NVIDIA, AMD, Qualcomm, Intel) 及 Microsoft 合作,以偵測硬體元數據以進行更好的記憶體估算。
  • KV 快取優化 (KV Cache Optimizations): 因果注意力是在個別模型層級進行配置的。例如,Gemma 3 利用滑動視窗注意力 (sliding window attention) 來優化上下文長度分配並增加並行度。
  • Llama 4 支援: 對於 Llama 4 Scout and Maverick, Ollama 實施了分塊注意力 (chunked attention)、針對長上下文的注意力調優、特定的 2D 旋轉嵌入 (rotary embedding) 以及 Mixture-of-Experts (MoE) 支援。

未來發展藍圖

Ollama 正在開發平台的進一步增強功能,包括:

  • 支援更長的上下文長度
  • 整合思考與推理能力
  • 具備串流回應的工具呼叫 (tool calling)
  • 啟用「電腦使用」 (computer use) 能力

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch