Qwen2.5-VL 版本說明

Qwen 已宣布發布 Qwen2.5-VL,這是一種旗艦視覺語言模型,相較於 Qwen2-VL 有顯著進步。該模型提供三種規模——3B、7B 和 72B——基礎版和指令版均透過 Hugging Face 和 ModelScope 提供。

主要功能與特性

Qwen2.5-VL 提供了數項高階功能,專為複雜的視覺推理和代理行為設計:

  • 視覺代理行為: 模型可以充當視覺代理,具備推理能力並能動態指導工具以供電腦和手機使用。
  • 長視頻理解: Qwen2.5-VL 支援超過一小時長度的視頻,並能透過識別相關視頻片段來精準定位特定事件。
  • 結構化輸出生成: 模型可以從發票、表單和表格的掃描中生成結構化資料(例如 JSON),方便在商業和金融領域使用。
  • 視覺定位: 它可以使用邊界框或點精準定位物件,並提供座標和屬性的穩定 JSON 輸出。
  • 進階視覺理解: 模型擅長識別常見物件,並能分析複雜的文字、圖表、圖示、圖形和佈局。

效能基準

Qwen2.5-VL 在多個領域展現競爭力的表現,包括大學程度問題、數學、文件理解和視頻分析。

  • 旗艦模型 (72B-Instruct): 達成最先進 (SOTA) 競爭力表現,並在理解圖表和文件方面顯示顯著優勢。無需任務特定微調即可作為視覺代理運作。
  • 中型模型 (7B-Instruct): 在多項任務中優於 GPT-4o-mini。
  • 邊緣 AI 解決方案 (3B): 優於先前 Qwen2-VL 版本的 7B 模型。

技術深度探討:模型能力

文件解析與文字識別

Qwen2.5-VL 具備升級的 OCR 能力,在多語言、多方向和多場景的文字識別方面表現更佳。一項關鍵創新是 QwenVL HTML 格式,這是一種基於 HTML 提取佈局資訊的獨特文件解析格式,使模型能夠解析雜誌、研究論文、網頁和手機螢幕截圖。

物件定位與圖像識別

模型使用邊界框和基於點的表示方式進行定位,以實現階層定位。其圖像識別已擴展至包含廣泛的類別,包括植物、動物、地標、影視 IP 以及各種商業產品。

視頻處理

為增強時間處理,Qwen2.5-VL 採用 動態幀率 (FPS) 訓練絕對時間編碼。這使模型能夠實現秒級事件定位,並總結小時級視頻的關鍵點。

架構改進

相較於 Qwen2-VL,Qwen2.5-VL 優化了模型對空間和時間尺度的感知方式,並簡化視覺編碼器以提高效率。

空間與時間感知

  • 空間: 模型會動態將不同大小的圖像轉換為長度不同的 token。它使用圖像的實際尺度(而非傳統的座標標準化)來表示座標(檢測框和點),使模型能直接學習圖像尺度。
  • 時間: 動態 FPS 訓練和絕對時間編碼將 mRoPE id 與時間速度對齊,使模型能透過時間維度 id 間隔來學習時間的節奏。

視覺編碼器優化

Qwen 從零開始訓練了一個原生動態解析度 ViT。為降低計算負載並解決負載不平衡,模型在大多數層使用 Window Attention(最大視窗大小為 8x8),僅保留四層進行 Full Attention。ViT 架構亦已更新為使用 RMSNorm 和 SwiGLU 結構,以保持與 LLM 的一致性。

Sources