Qwen2-VL 發布:開源 2B/7B 視覺語言模型與 72B API,具備最先進的圖像、影片與多語言能力
TL;DR
Qwen 發布了 Qwen2‑VL,一個全新的視覺語言模型系列(2B、7B 開源、72B 透過 API),在圖像、多圖像與長影片理解方面達到最先進的表現,支援圖像中數十種語言,且可作為行動裝置與機器人等設備的視覺代理。
Qwen2‑VL 概述
Qwen2‑VL 是基於 Qwen2 語言骨幹構建的最新視覺語言模型系列。此發布包含三種模型規模:
- Qwen2‑VL‑2B – 為行動部署優化的緊湊模型。
- Qwen2‑VL‑7B – 成本效益高且保留圖像、多圖像與影片功能的模型。
- Qwen2‑VL‑72B – 透過 API 提供的大型模型,提供頂級效能,常常超越如 GPT‑4o 與 Claude 3.5‑Sonnet 等閉源競爭者。
這三種變體共享相同的架構,將 Vision Transformer(≈600 M 參數)與 Qwen2 大語言模型結合,且以 Apache 2.0 授權釋出(2B 與 7B)或透過商業 API(72B)。
主要技術進展
Naive Dynamic Resolution
Qwen2‑VL 引入了 Naive Dynamic Resolution,將任意圖像解析度映射到動態數量的視覺標記。此方法消除早期模型固定大小標記的瓶頸,更貼近人類視覺感知,使模型能在不失細節的情況下處理任何圖像尺寸。
多模態旋轉位置嵌入 (M‑ROPE)
M‑ROPE 機制將原始旋轉嵌入分解為三個組件(時間、高度、寬度)。透過此方式,模型同時編碼 1‑D 文本、2‑D 視覺與 3‑D 影片的位置信息,提升其對空間與時間關係的推理能力。
效能亮點
圖像與文件理解
- State‑of‑the‑art 在 MathVista、DocVQA、RealWorldQA 與 MTVQA 等基準測試上表現卓越。
- 7B 模型在以文件為中心的任務(DocVQA)與多語言文字圖像理解(MTVQA)上表現突出,取得同等規模開源模型中最高的報告分數。
- 雖然 2B 模型體積小,但在文件與影片任務上仍優於許多同儕。
影片理解
- Qwen2‑VL 能處理長於 20 分鐘 的影片,實現高品質的影片問答、對話與內容創作。
- 72B 模型在影片基準測試上明顯優於 GPT‑4o 與 Claude 3.5‑Sonnet,而 7B 與 2B 模型在成本敏感的應用中仍具競爭力。
圖像中的多語言文字
- 除了英語與中文,模型還能理解圖像中大多數歐洲語言、日語、韓語、阿拉伯語、越南語及其他文字腳本。
示範能力
加強的物件與手寫文字辨識
Qwen2‑VL 能辨識複雜的物件關係,並準確讀取多語言的手寫文字。在提供的範例中,它精確列出堆疊盒子的顏色與數字。
視覺推理與程式碼生成
模型能解決以螢幕截圖呈現的演算法問題,產生正確的 Python 實作。它亦能解讀圖表與高度失真比例的圖像,將視覺感知與邏輯推理結合。
影片摘要與即時互動
Qwen2‑VL 能產生詳細的影片描述,回答後續問題(例如「太空人的衣服是什麼顏色?」),並維持即時聊天流程,有效充當個人影片助理。
視覺代理與函式呼叫
透過將視覺線索與函式呼叫結合,Qwen2‑VL 能根據所見取得即時資料(航班狀態、天氣、包裹追蹤)。此功能為行動裝置、機器人及其他設備的自主運作鋪路。
限制
- 模型無法從影片中提取音訊。
- 知識截至 2023 年 6 月 為止。
- 複雜指令的準確性無法保證。
- 在計數、細粒度字元辨識與 3‑D 空間感知方面仍有弱點。
入門指南
API 存取 (72B)
from openai import OpenAI
import os, base64
def encode_image(path):
with open(path, "rb") as f:
return base64.b64encode(f.read()).decode("utf-8")
image_path = "dog_and_girl.jpeg"
base64_image = encode_image(image_path)
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1")
completion = client.chat.completions.create(
model="qwen-vl-max-0809",
messages=[{"role": "user",
"content": [{"type": "text", "text": "What is this?"},
{"type": "image_url",
"image_url": {"url": "https://.../dog_and_girl.jpeg"}},
{"type": "image_url",
"image_url": {"url": f"data:image/jpeg;base64,{base64_image}"}}]
}],
top_p=0.8, stream=True, stream_options={"include_usage": True})
for chunk in completion:
print(chunk.model_dump_json())
開源模型 (2B 與 7B)
從原始碼安裝最新的 Transformers,以避免 KeyError: 'qwen2_vl':
pip install git+https://github.com/huggingface/transformers
安裝 visual‑utility 套件:
pip install qwen-vl-utils
使用 Hugging Face Transformers 的最小推論腳本(7B):
from transformers import Qwen2VLForConditionalGeneration, AutoProcessor
from qwen_vl_utils import process_vision_info
model = Qwen2VLForConditionalGeneration.from_pretrained(
"Qwen/Qwen2-VL-7B-Instruct", device_map="auto")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2-VL-7B-Instruct")
messages = [{"role": "user",
"content": [{"type": "image",
"image": "https://.../demo.jpeg"},
{"type": "text", "text": "Describe this image."}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
image_inputs, video_inputs = process_vision_info(messages)
inputs = processor(text=[text], images=image_inputs, videos=video_inputs,
padding=True, return_tensors="pt")
generated_ids = model.generate(**inputs, max_new_tokens=128)
output = processor.batch_decode(generated_ids[:, inputs.input_ids.shape[-1]:],
skip_special_tokens=True)
print(output)
此倉庫亦提供量化(AutoGPTQ、AutoAWQ)、使用 vLLM 部署以及透過 Llama‑Factory 微調的指引。
授權與可用性
- Qwen2‑VL‑2B 與 Qwen2‑VL‑7B – Apache 2.0 授權,託管於 Hugging Face 與 ModelScope。
- Qwen2‑VL‑72B – 商業 API(DashScope),採用使用量計費。
未來方向
Qwen 的路線圖提到將在未來的語言骨幹上構建更強大的視覺語言模型,並擴展至更多模態,目標是打造能在統一框架下處理視覺、音訊與其他感官資料的「全能模型」。
參考與資源
- Demo: https://huggingface.co/spaces/Qwen/Qwen2-VL
- GitHub: https://github.com/QwenLM/Qwen2-VL
- Model Collections: https://huggingface.co/collections/Qwen/qwen2-vl-66cee7455501d7126940800d
- API Documentation: https://help.aliyun.com/zh/model-studio/developer-reference/qwen-vl-api
- Discord Community: https://discord.gg/yPEP2vHTu4
SUMMARY: Qwen 發布了 Qwen2-VL,一個全新的視覺語言模型系列(2B、7B 開源、72B API),在圖像、文件、多語言以及長影片理解方面達到最先進的表現,同時支援視覺代理功能。
TITLE: Qwen2-VL 發布:開源 2B/7B 視覺語言模型與 72B API,具備最先進的圖像、影片與多語言能力