Pixtral 12B 發佈說明

Mistral AI 已宣布推出 Pixtral 12B,這是一款原生多模態模型,旨在處理交錯的圖像與文本數據。Pixtral 12B 被定位為 Mistral Nemo 12B 的直接替代方案,在提供頂尖多模態推理能力的同時,也能在純文本基準測試(包括程式碼、數學和指令遵循)中保持高性能。

技術架構

Pixtral 採用由視覺編碼器(vision encoder)和多模態 Transformer 解碼器組成的雙組件架構。

視覺編碼器與可變圖像支援

Pixtral 具備一個全新的、從零開始訓練的 400M 參數視覺編碼器。一項關鍵的技術進步是其對可變圖像尺寸和長寬比的原生支援。圖像會以其原生解析度通過編碼器,並將每個 16x16 的補丁(patch)轉換為圖像標記(image tokens)。為了維持空間感知能力,模型使用 [IMG BREAK] 標記來區分行,並使用 [IMG END] 標記來標記圖像的結束。這使得模型能夠高效處理高解析度複雜圖表,同時為較小的圖像保持快速推理。

多模態解碼器與上下文窗口

該模型採用基於 Mistral Nemo 的 12B 參數多模態解碼器。它在交錯的圖像與文本數據上進行訓練,以預測下一個文本標記。此架構支持在 128K token 的長上下文窗口內處理多張圖像。

性能與基準測試

Pixtral 12B 旨在提供同類最佳的多模態推理能力,且不會降低其基礎文本模型的文本能力。

多模態推理

Pixtral 在 MMMU 推理基準測試中獲得了 52.5% 的分數,超越了數個規模更大的模型。它在文件問答、圖表與圖形理解以及多模態推理方面展現了強大的能力。

指令遵循

與其他開源多模態模型相比,Pixtral 在指令遵循方面展現出顯著優勢。Mistral AI 報告稱,其在文本 IF-EvalMT-Bench 中的表現比最接近的開源(OSS)模型相對提升了 20%。為了驗證這些說法,Mistral AI 開發了這些基準測試的多模態版本,即 MM-IF-EvalMM-MT-Bench,Pixtral 在這些測試中同樣優於開源替代方案。

對比評估

使用一致的評估框架和提示詞(prompts),Pixtral 與開源和封閉模型進行了對比。結果顯示,Pixtral 顯著優於規模相似的開源模型,並在多模態基準測試上達到或超過了如 LLaVa OneVision 72B 等規模大得多的模型。它在多個案例中也優於 Claude 3 Haiku 等封閉模型。

能力與使用場景

Pixtral 12B 能夠處理各種複雜的視覺任務:

  • 複雜圖形推理: 從視覺圖表中提取並結構化數據(例如,從圖表中識別出 GDP 最高的前幾名國家)。
  • 圖表分析: 解釋訓練損失曲線(training loss curves)並識別數據趨勢中的特定失效點。
  • 多圖處理: 將多張基於圖像的表格資訊整合進一個單一的結構化 Markdown 表格中。
  • 圖像轉程式碼生成: 將視覺化的網站原型圖(mockups)轉換為功能性的 HTML 和 CSS 程式碼。
  • 自然場景理解: 解釋自然照片中的錯覺與空間關係。

可用性與授權

Pixtral 12B 以 Apache 2.0 授權發佈。可以透過以下方式存取:

  • Le Chat: Mistral AI 的對話式聊天介面。
  • La Plateforme: 可透過 API 進行整合以應用於應用程式中。
  • 本地部署: 透過 mistral-inference 和 vLLM 函式庫支持,以獲得更高的服務吞吐量。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch