Qwen3-VL 发布说明
Ollama 已宣布在云端平台上线 Qwen3-VL,本地版本计划于未来版本发布。Qwen3-VL 是 Qwen 系列中功能最强大的视觉语言模型,旨在将高级视觉识别与先进的推理及智能体能力相结合。
高级视觉与智能体能力
Qwen3-VL 作为视觉智能体,能够通过识别界面元素、理解功能并调用工具来操作 PC 和移动设备的 GUI,完成任务。它还提供「视觉编码增强」功能,可直接从图像或视频生成 HTML、CSS、JS 和 Draw.io 文件。
空间感知与定位能力
该模型具备先进的空间感知能力,能够判断物体的位置、视角和遮挡情况。这提供了更强的二维定位能力,并引入了三维定位功能,对空间推理和具身智能应用至关重要。
多模态推理与识别
Qwen3-VL 在 STEM 和数学领域表现出色,能够提供因果分析和基于证据的逻辑回答。其视觉识别能力通过更广泛、更高品质的预训练得到提升,可识别更广泛的物体,包括地标、动植物、名人和产品。
文档理解与长上下文处理
Qwen3-VL 提供无缝的文本-视觉融合,确保文本理解能力与纯大型语言模型(LLMs)相当。
扩展的 OCR 与结构解析
该模型的光学字符识别(OCR)能力已扩展至支持 32 种语言,较之前的 19 种有所增加。它在模糊、倾斜和低光条件下表现出更强的鲁棒性,并在处理术语、罕见或古文字方面性能更优。此外,模型在解析长文档结构方面也有所提升。
视频与长上下文处理
Qwen3-VL 拥有原生 256K 标记的上下文窗口,可扩展至 1M 标记。这使得模型能够处理长达数小时的视频和整本书籍,支持秒级索引和完整召回。
部署与集成
Qwen3-VL 目前可通过 Ollama 的云服务获取。用户可使用以下方式访问该模型的 235B 参数版本:
命令行界面(CLI)
用户可直接通过以下命令运行模型:
ollama run qwen3-vl:235b-cloud
软件库
Ollama 提供官方的 JavaScript 和 Python 库用于集成。两个库均支持非流式和流式输出。例如,使用 Python 库时,用户可按如下方式拉取模型并与其对话:
from ollama import chat
response = chat(
model='qwen3-vl:235b-cloud',
messages=[{
'role': 'user',
'content': '这是什么?',
'images': ['./image.jpg']
}],
)
print(response.message.content)
API 访问
该模型可通过 Ollama 云 API 和 OpenAI 兼容 API 访问。OpenAI 兼容端点支持聊天补全、补全和嵌入功能,使用 https://ollama.com/v1 作为基础 URL。
Sources
- OriginalQwen3-VL
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch