Pixtral Large 發佈說明

Mistral AI 推出了 Pixtral Large,這是一款 124B 開放權重多模態模型,旨在提供前沿級別的圖像理解能力。該模型基於 Mistral Large 2 構建,能夠高效處理文件、圖表和自然圖像,且不會損害基礎模型原有的純文本理解能力。

模型架構與規格

Pixtral Large 利用多模態解碼器和視覺編碼器來處理視覺和文本數據。其技術規格包括:

  • 參數: 一個 123B 多模態解碼器搭配一個 1B 參數的視覺編碼器(總計 124B)。
  • 上下文窗口: 128K 上下文窗口,能夠容納至少 30 張高解析度圖像。
  • 可用性: 該模型可透過 Mistral API 以 pixtral-large-latest 使用,並可在 le Chat 上使用,同時也在 HuggingFace 上以開放權重形式提供。
  • 授權: 根據 Mistral Research License (MRL) 提供用於研究和教育用途,並提供獨立的 Mistral Commercial License 用於生產和商業實驗。

性能基準測試

Pixtral Large 在多個多模態基準測試中展現了頂尖的性能,經常超越開放權重模型和專有模型。

數學與文件推理

在測試視覺數據複雜數學推理能力的 MathVista 基準測試中,Pixtral Large 取得了 69.4% 的分數,超越了所有其他受測模型。在利用 ChartQA 和 DocVQA 對複雜圖表和文件進行評估時,該模型的表現優於 GPT-4o 和 Gemini-1.5 Pro。

真實世界與人類偏好評估

在 MM-MT-Bench(一種旨在反映真實世界多模態 LLM 使用案例的開源、基於裁判的評估)中,Pixtral Large 的表現優於 Claude-3.5 Sonnet (new)、Gemini-1.5 Pro 和 GPT-4o (latest)。此外,在 LMSys Vision Leaderboard 上,Pixtral Large 是排名最高的開放權重模型,領先其最接近的競爭對手近 50 ELO 分數,並超越了 2024 年 8 月版本的 GPT-4o 等專有模型。

視覺理解能力

Pixtral Large 能夠在各種視覺格式中進行複雜推理,包括:

  • 多語言 OCR 與推理: 模型可以從圖像中提取數據(例如不同語言的收據)並根據該數據進行數學計算。
  • 圖表分析: 模型可以識別技術數據中的特定趨勢和異常,例如在損失曲線圖中識別訓練損失不穩定開始的確切步數。
  • 視覺信息提取: 模型可以從網站截圖中準確地識別並列出實體(例如公司名稱)。

Mistral Large 24.11 更新

在發佈 Pixtral Large 的同時,Mistral AI 也將其頂尖的文本模型更新至 24.11 版本。此更新相較於 24.07 版本提供了顯著的改進,特別是在:

  • 長上下文理解
  • 函數調用準確性
  • 系統提示詞處理

Mistral Large 24.11 適用於企業級 RAG 和代理工作流,包括任務自動化和語義文件理解。它可透過 API 以 pixtral-large-latest 使用,並可在 HuggingFace 上進行自我部署。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch