Qwen3-VL 發佈說明
Ollama 已宣布在其雲端平台上提供 Qwen3-VL,並計劃在未來的版本中提供本地可用性。Qwen3-VL 是 Qwen 系列中最強大的視覺語言模型,旨在將高階視覺識別與先進的推理及代理能力相結合。
進階視覺與代理能力
Qwen3-VL 可作為視覺代理運作,透過識別元素、理解功能並調用工具來操作 PC 和行動裝置的 GUI,從而完成任務。它還提供了「視覺編碼增強 (Visual Coding Boost)」,允許模型直接從圖像或影片中生成 HTML、CSS、JS 和 Draw.io 檔案。
空間感知與定位 (Grounding)
該模型具備先進的空間感知能力,使其能夠判斷物體位置、視角和遮擋情況。這提供了更強的 2D 定位能力,並引入了 3D 定位能力,這對於空間推理和具身 AI 應用至關重要。
多模態推理與識別
Qwen3-VL 在 STEM 和數學領域表現出色,能提供因果分析和基於證據的邏輯回答。其視覺識別能力已透過更廣泛、更高質量的預訓練得到升級,使其能夠識別更廣泛的物體,包括地標、動植物、名人以及產品。
文檔理解與長上下文
Qwen3-VL 提供無縫的文本-視覺融合,確保文本理解能力與純大型語言模型 (LLMs) 持平。
擴展的 OCR 與結構解析
該模型的光學字元識別 (OCR) 能力已從 19 種語言擴展到支持 32 種語言。它被設計為在模糊、傾斜和低光照條件下仍具備魯棒性,並在處理專業術語、罕見或古文字時展現出更佳的性能。此外,該模型還改進了解析長文檔結構的能力。
影片與長上下文處理
Qwen3-VL 具有 256K token 的原生上下文窗口,且可擴展至 1M token。這使得模型能夠處理長達數小時的影片和整本書籍,並具備秒級索引和完整的召回能力。
部署與集成
Qwen3-VL 目前可透過 Ollama 的雲端服務使用。使用者可以透過以下方式存取 235B 參數版本的模型:
命令列介面 (CLI)
使用者可以直接使用以下命令運行模型:
ollama run qwen3-vl:235b-cloud
軟體函式庫
Ollama 提供官方的 JavaScript 和 Python 函式庫用於集成。這兩個函式庫都支持非串流和串流輸出。例如,使用 Python 函式庫,使用者可以拉取模型並進行對話,如下所示:
from ollama import chat
response = chat(
model='qwen3-vl:235b-cloud',
messages=[{
'role': 'user',
'content': 'What is this?',
'images': ['./image.jpg']
}],
)
print(response.message.content)
API 存取
該模型可透過 Ollama 雲端 API 和與 OpenAI 相容的 API 存取。OpenAI 相容的端點支持 chat completions、completions 和 embeddings,並使用 https://ollama.com/v1 作為基礎 URL。
Sources
- OriginalQwen3-VL
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch