Pixtral Large 發佈說明
Mistral AI 推出了 Pixtral Large,這是一款 124B 開放權重多模態模型,旨在提供前沿級別的圖像理解能力。該模型基於 Mistral Large 2 構建,能夠高效處理文件、圖表和自然圖像,且不會損害基礎模型原有的純文本理解能力。
模型架構與規格
Pixtral Large 利用多模態解碼器和視覺編碼器來處理視覺和文本數據。其技術規格包括:
- 參數: 一個 123B 多模態解碼器搭配一個 1B 參數的視覺編碼器(總計 124B)。
- 上下文窗口: 128K 上下文窗口,能夠容納至少 30 張高解析度圖像。
- 可用性: 該模型可透過 Mistral API 以
pixtral-large-latest使用,並可在 le Chat 上使用,同時也在 HuggingFace 上以開放權重形式提供。 - 授權: 根據 Mistral Research License (MRL) 提供用於研究和教育用途,並提供獨立的 Mistral Commercial License 用於生產和商業實驗。
性能基準測試
Pixtral Large 在多個多模態基準測試中展現了頂尖的性能,經常超越開放權重模型和專有模型。
數學與文件推理
在測試視覺數據複雜數學推理能力的 MathVista 基準測試中,Pixtral Large 取得了 69.4% 的分數,超越了所有其他受測模型。在利用 ChartQA 和 DocVQA 對複雜圖表和文件進行評估時,該模型的表現優於 GPT-4o 和 Gemini-1.5 Pro。
真實世界與人類偏好評估
在 MM-MT-Bench(一種旨在反映真實世界多模態 LLM 使用案例的開源、基於裁判的評估)中,Pixtral Large 的表現優於 Claude-3.5 Sonnet (new)、Gemini-1.5 Pro 和 GPT-4o (latest)。此外,在 LMSys Vision Leaderboard 上,Pixtral Large 是排名最高的開放權重模型,領先其最接近的競爭對手近 50 ELO 分數,並超越了 2024 年 8 月版本的 GPT-4o 等專有模型。
視覺理解能力
Pixtral Large 能夠在各種視覺格式中進行複雜推理,包括:
- 多語言 OCR 與推理: 模型可以從圖像中提取數據(例如不同語言的收據)並根據該數據進行數學計算。
- 圖表分析: 模型可以識別技術數據中的特定趨勢和異常,例如在損失曲線圖中識別訓練損失不穩定開始的確切步數。
- 視覺信息提取: 模型可以從網站截圖中準確地識別並列出實體(例如公司名稱)。
Mistral Large 24.11 更新
在發佈 Pixtral Large 的同時,Mistral AI 也將其頂尖的文本模型更新至 24.11 版本。此更新相較於 24.07 版本提供了顯著的改進,特別是在:
- 長上下文理解
- 函數調用準確性
- 系統提示詞處理
Mistral Large 24.11 適用於企業級 RAG 和代理工作流,包括任務自動化和語義文件理解。它可透過 API 以 pixtral-large-latest 使用,並可在 HuggingFace 上進行自我部署。
Sources
- OriginalPixtral Large
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch