Visual Salamandra 7B 發布
Visual Salamandra 採用晚期融合(late-fusion)架構,以彌合視覺與文字模態之間的差距。系統基於 Salamandra Instructed 7B 模型構建,並整合以下元件:
- Vision Encoder: Google 的 SigLIP-So400m 編碼器,將圖像以 384x384 解析度、14 個 patch 處理。
- Projector: 一個自訂訓練的兩層多層感知器(MLP),將來自編碼器的圖像嵌入映射至 LLM 的潛在空間。
- Backbone: Salamandra Instructed 7B 基礎模型。
技術架構與視覺-語言對齊
Visual Salamandra 利用晚期融合架構來橋接視覺與文字模態之間的差距。系統建立於 Salamandra Instructed 7B 模型之上,並整合以下組件:
- Vision Encoder: Google 的 SigLIP-So400m 編碼器,將圖像以 384x384 解析度、14 個 patch 處理。
- Projector: 一個自訂訓練的兩層多層感知器(MLP),將來自編碼器的圖像嵌入映射至 LLM 的潛在空間。
- Backbone: Salamandra Instructed 7B 基礎模型。
四階段訓練流程
該模型透過結構化的四階段訓練管線開發,以確保穩健的對齊與泛化:
- Projector Pre-training(投影器預訓練): 初始階段專注於訓練 MLP 投影器,使圖像特徵與 LLM 的潛在空間對齊。
- High-Quality Vision Pretraining(高品質視覺預訓練): 編碼器、投影器與 LLM 共同使用精緻資料集(包括重新標註的圖像與 OCR 資料)進行訓練。
- Instruction Tuning(指令微調): 透過具體的視覺任務(如光學字符辨識(OCR)與視覺問答(VQA)),訓練模型遵循使用者指令。
- Full Multimodal Tuning(完整多模態微調): 最後階段透過結合僅文字範例、單張圖像、多張圖像與影片資料,優化模型在真實情境中的泛化能力。
為支援此流程,實驗室使用了 610 萬指令微調實例,其中包括 84.2 萬僅文字樣本,並從 LLaVA Next、Cambrian、AI2D 等資料集抽取,以提升數學推理、文件理解與視覺定位能力。
多語言支援與歐洲語言焦點
Visual Salamandra 直接將語言多樣性整合至其多模態指令微調框架中。透過聚焦於歐洲語言,模型旨在縮小多模態 AI 研究中弱勢語言的資源差距,確保這些語言能享有與主流語言相同程度的指令微調與視覺任務對齊。
能力與應用
Visual Salamandra 能夠理解並產生符合情境的回應,支援多樣輸入。主要應用包括:
- Visual Question Answering (VQA): 提供針對圖像或影片的情境感知回應。
- Optical Character Recognition (OCR): 從圖表、場景與文件中轉錄文字。
- Document and Chart Understanding: 分析含文字的圖形內容與複雜視覺文件。
- Mathematical Reasoning: 解決具視覺基礎的數學問題。
- Instruction-based Image Interaction: 根據詳細指令執行定位任務與圖像說明生成。
- Video Analysis: 模型架構支援未來在事件偵測、多模態敘事與影片摘要等方面的發展。
限制與倫理考量
儘管具備上述能力,Visual Salamandra 仍存在已知的限制:
- Hallucinations(幻覺): 當視覺輸入模糊時,模型可能產生看似合理卻不正確的答案。
- OCR Complexity(OCR 複雜度): 面對密集文件排版或高度複雜的 OCR 任務時,效能仍具挑戰。
- Bias(偏見): 雖然使用過濾與授權的資料集訓練,模型仍可能呈現偏見或不準確之處。
Visual Salamandra 以 Apache License 2.0 版授權發布,供研究與非商業用途使用。