PaliGemma 2 Mix 發布說明

Google 已發布 PaliGemma 2 mix,一系列經指令調整的視覺語言模型(VLM),旨在展示預訓練 PaliGemma 2 檢查點在多樣化學術數據集上微調時的性能能力。儘管原始的 PaliGemma 2 預訓練(pt)模型旨在作為特定下游任務的遷移學習基礎模型,但 mix 變體為廣泛的視覺語言應用提供了多功能基線。

模型架構與變體

PaliGemma 2 建構於 SigLIP 視覺編碼器與 Gemma 2 語言模型之上。mix 系列提供三種參數規模及多種解析度,以在效能與運算效率之間取得平衡:

參數數量 解析度選項
3B 224x224, 448x448
10B 224x224, 448x448
28B 224x224, 448x448

模型同時提供 Hugging Face Transformers 與 JAX 框架版本。

核心功能與任務支援

PaliGemma 2 mix 模型能夠處理四個主要的視覺語言任務類別:

  • 一般視覺語言任務:包括視覺問答(VQA)和圖像指稱。
  • 文件理解:聚焦於資訊圖表、圖表和圖示的視覺問答。
  • 文字辨識 (OCR):文字偵測、對含文字圖像進行字幕生成,以及在文字密集圖像上的視覺問答。
  • 定位:物體偵測與圖像分割。

提示策略

雖然 PaliGemma 2 mix 支援開放式提示以獲得更佳效能,但它仍與先前版本中使用的任務特定前綴相容。

開放式提示 建議用於大多數任務。然而,任務前綴 仍然有效,並遵循以下模式:

  • caption {lang}:簡短的 COCO 風格字幕。
  • describe {lang}:詳細的描述性字幕。
  • ocr:光學字元辨識。
  • answer {lang} {question}:關於圖像內容的問答。
  • question {lang} {answer}:基於給定答案的問題生成。

必要前綴:物體偵測與圖像分割需要特定前綴才能運作:

  • detect {object description}:返回列出物體的邊界框。
  • segment {object description}; {object description}:為指定物體建立圖像分割。

效能比較與評估

對 3B 與 10B 變體(於 448x448 解析度)的評估顯示,較大的模型通常能提供更精確且詳細的回應,尤其在複雜推理與文件理解方面。

  • 一般 VQA:3B 與 10B 模型均能正確計數物體(例如計數糖果),並提供描述性場景分析。
  • 文件理解:10B 模型在對解析度敏感的任務中展現更高的準確度,正確識別最佳變體(448px),而 3B 模型則給出較不準確的回應。
  • 文字辨識:兩個模型均展現強大的 OCR 能力,能從圖像中精準擷取日期、價格及複雜選單文字。
  • 定位:模型能根據描述性提示(例如 "bird on a stick")偵測與分割物體,而不僅限於簡單的類別標籤。

實作與微調

PaliGemma 2 mix 可使用 Hugging Face transformers 函式庫進行實作。該過程涉及使用 PaliGemmaProcessor 進行輸入處理,以及使用 PaliGemmaForConditionalGeneration 載入模型並以 $ ext{bfloat16}$ 精度運算。

希望進一步自訂模型的使用者,可以使用與預訓練 PaliGemma 2 模型相同的方法對 mix 檢查點進行微調。詳細教學可經由 smol-vision GitHub repository 取得。

Sources