Qwen3-VL 發佈說明

Ollama 已宣布在其雲端平台上提供 Qwen3-VL,並計劃在未來的版本中提供本地可用性。Qwen3-VL 是 Qwen 系列中最強大的視覺語言模型,旨在將高階視覺識別與先進的推理及代理能力相結合。

進階視覺與代理能力

Qwen3-VL 可作為視覺代理運作,透過識別元素、理解功能並調用工具來操作 PC 和行動裝置的 GUI,從而完成任務。它還提供了「視覺編碼增強 (Visual Coding Boost)」,允許模型直接從圖像或影片中生成 HTML、CSS、JS 和 Draw.io 檔案。

空間感知與定位 (Grounding)

該模型具備先進的空間感知能力,使其能夠判斷物體位置、視角和遮擋情況。這提供了更強的 2D 定位能力,並引入了 3D 定位能力,這對於空間推理和具身 AI 應用至關重要。

多模態推理與識別

Qwen3-VL 在 STEM 和數學領域表現出色,能提供因果分析和基於證據的邏輯回答。其視覺識別能力已透過更廣泛、更高質量的預訓練得到升級,使其能夠識別更廣泛的物體,包括地標、動植物、名人以及產品。

文檔理解與長上下文

Qwen3-VL 提供無縫的文本-視覺融合,確保文本理解能力與純大型語言模型 (LLMs) 持平。

擴展的 OCR 與結構解析

該模型的光學字元識別 (OCR) 能力已從 19 種語言擴展到支持 32 種語言。它被設計為在模糊、傾斜和低光照條件下仍具備魯棒性,並在處理專業術語、罕見或古文字時展現出更佳的性能。此外,該模型還改進了解析長文檔結構的能力。

影片與長上下文處理

Qwen3-VL 具有 256K token 的原生上下文窗口,且可擴展至 1M token。這使得模型能夠處理長達數小時的影片和整本書籍,並具備秒級索引和完整的召回能力。

部署與集成

Qwen3-VL 目前可透過 Ollama 的雲端服務使用。使用者可以透過以下方式存取 235B 參數版本的模型:

命令列介面 (CLI)

使用者可以直接使用以下命令運行模型:

ollama run qwen3-vl:235b-cloud

軟體函式庫

Ollama 提供官方的 JavaScript 和 Python 函式庫用於集成。這兩個函式庫都支持非串流和串流輸出。例如,使用 Python 函式庫,使用者可以拉取模型並進行對話,如下所示:

from ollama import chat

response = chat(
    model='qwen3-vl:235b-cloud', 
    messages=[{ 
        'role': 'user', 
        'content': 'What is this?', 
        'images': ['./image.jpg'] 
    }],
)
print(response.message.content)

API 存取

該模型可透過 Ollama 雲端 API 和與 OpenAI 相容的 API 存取。OpenAI 相容的端點支持 chat completions、completions 和 embeddings,並使用 https://ollama.com/v1 作為基礎 URL。

Sources

相關