Mistral 7B 發布說明

Mistral AI 宣布推出 Mistral 7B,這是一款擁有 73 億參數的語言模型,旨在以相對其規模提供高性能量。該模型以 Apache 2.0 許可證釋出,允許無限制使用與部署。

性能基準

Mistral 7B 在所有評估基準上均超越 Llama 2 13B,並在許多方面與 Llama 1 34B 相當。在程式碼與推理方面,其表現被描述為遠超這些模型,並接近 CodeLlama 7B 的性能,同時在英文任務上仍保持高水準。

根據 Mistral AI 的說法,該模型在推理、理解與 STEM 推理(MMLU)等領域的表現等同於規模超過其三倍的 Llama 2 模型。這種效率帶來顯著的記憶體節省與更高的吞吐量。

評估類別

性能在多個主題上進行測量:

  • 常識推理:Hellaswag、Winogrande、PIQA、SIQA、OpenbookQA、ARC-Easy、ARC-Challenge 與 CommonsenseQA 的零樣本平均值。
  • 世界知識:NaturalQuestions 與 TriviaQA 的五樣本平均值。
  • 閱讀理解:BoolQ 與 QuAC 的零樣本平均值。
  • 數學:8 樣本 GSM8K(maj@8)與 4 樣本 MATH(maj@4)的平均值。
  • 程式碼:零樣本 Humaneval 與三樣本 MBPP 的平均值。
  • 綜合結果:五樣本 MMLU、三樣本 BBH 與三至五樣本 AGI Eval(僅英文多選題)。

技術架構

Mistral 7B 實作了兩項主要的架構特性,以優化推論速度與序列處理能力:

分組查詢注意力(GQA)

Mistral 7B 使用分組查詢注意力(GQA)以實現更快的推論速度。

滑動視窗注意力(SWA)

滑動視窗注意力(SWA)讓模型能以較低的計算成本處理更長的序列。在此機制中,每一層會關注前 4,096 個隱藏狀態,從而實現線性計算成本 O(滑動視窗.seq_len)。

SWA 利用變壓器的堆疊層,使詞元能存取比視窗大小所暗示更久遠的資訊。例如,第 k 層的詞元會關注第 k-1 層視窗中的詞元,而這些詞元又曾關注更早的詞元。這有效延長了模型注意力的範圍。

實際上,結合 FlashAttention 與 xFormers 的改進,SWA 在 16k 長度序列、4k 視窗的情況下可提供兩倍的加速。此外,固定的注意力範圍讓模型能使用旋轉緩衝區,將快取大小限制在滑動視窗大小,從而將 8,192 長度序列的推論快取記憶體減少一半,且不影響品質。

微調與指令遵循

為展示基礎模型的泛化能力,Mistral AI 發布了 Mistral 7B Instruct,這是一個在 HuggingFace 上公開的指令資料集上微調的版本。

Mistral 7B Instruct 在 MT-Bench 基準上超越所有其他 7B 模型,並與 13B 聊天模型相當。該模型在微調過程中未使用專有資料或特定「技巧」。

Mistral AI 指出,目前 Instruct 模型尚無內容審查機制,並正在尋求社群參與,以開發適用於需要內容審查輸出環境的防護機制。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch