PaliGemma 2 Mix 發布說明
Google 已發布 PaliGemma 2 mix,一系列經指令調整的視覺語言模型(VLM),旨在展示預訓練 PaliGemma 2 檢查點在多樣化學術數據集上微調時的性能能力。儘管原始的 PaliGemma 2 預訓練(pt)模型旨在作為特定下游任務的遷移學習基礎模型,但 mix 變體為廣泛的視覺語言應用提供了多功能基線。
模型架構與變體
PaliGemma 2 建構於 SigLIP 視覺編碼器與 Gemma 2 語言模型之上。mix 系列提供三種參數規模及多種解析度,以在效能與運算效率之間取得平衡:
| 參數數量 | 解析度選項 |
|---|---|
| 3B | 224x224, 448x448 |
| 10B | 224x224, 448x448 |
| 28B | 224x224, 448x448 |
模型同時提供 Hugging Face Transformers 與 JAX 框架版本。
核心功能與任務支援
PaliGemma 2 mix 模型能夠處理四個主要的視覺語言任務類別:
- 一般視覺語言任務:包括視覺問答(VQA)和圖像指稱。
- 文件理解:聚焦於資訊圖表、圖表和圖示的視覺問答。
- 文字辨識 (OCR):文字偵測、對含文字圖像進行字幕生成,以及在文字密集圖像上的視覺問答。
- 定位:物體偵測與圖像分割。
提示策略
雖然 PaliGemma 2 mix 支援開放式提示以獲得更佳效能,但它仍與先前版本中使用的任務特定前綴相容。
開放式提示 建議用於大多數任務。然而,任務前綴 仍然有效,並遵循以下模式:
caption {lang}:簡短的 COCO 風格字幕。describe {lang}:詳細的描述性字幕。ocr:光學字元辨識。answer {lang} {question}:關於圖像內容的問答。question {lang} {answer}:基於給定答案的問題生成。
必要前綴:物體偵測與圖像分割需要特定前綴才能運作:
detect {object description}:返回列出物體的邊界框。segment {object description}; {object description}:為指定物體建立圖像分割。
效能比較與評估
對 3B 與 10B 變體(於 448x448 解析度)的評估顯示,較大的模型通常能提供更精確且詳細的回應,尤其在複雜推理與文件理解方面。
- 一般 VQA:3B 與 10B 模型均能正確計數物體(例如計數糖果),並提供描述性場景分析。
- 文件理解:10B 模型在對解析度敏感的任務中展現更高的準確度,正確識別最佳變體(448px),而 3B 模型則給出較不準確的回應。
- 文字辨識:兩個模型均展現強大的 OCR 能力,能從圖像中精準擷取日期、價格及複雜選單文字。
- 定位:模型能根據描述性提示(例如 "bird on a stick")偵測與分割物體,而不僅限於簡單的類別標籤。
實作與微調
PaliGemma 2 mix 可使用 Hugging Face transformers 函式庫進行實作。該過程涉及使用 PaliGemmaProcessor 進行輸入處理,以及使用 PaliGemmaForConditionalGeneration 載入模型並以 $ ext{bfloat16}$ 精度運算。
希望進一步自訂模型的使用者,可以使用與預訓練 PaliGemma 2 模型相同的方法對 mix 檢查點進行微調。詳細教學可經由 smol-vision GitHub repository 取得。