Falcon 2 11B 發布說明

TII 推出了 Falcon 2,這是一代新型開源模型,具備 11B 參數的大型語言模型(LLM)以及相應的視覺語言模型(VLM)。這些模型旨在為社群提供更小、更高效的模型,降低推理成本,同時在多語言和多模態上保持高性能。

Falcon2-11B LLM 技術規格

Falcon2-11B 是一個預訓練語言模型,使用超過 5,000 億個 token 的 RefinedWeb 資料進行訓練,並輔以精選語料庫,包括技術資料、程式碼與對話資料。

訓練策略與資料

模型採用了四階段策略,以逐步增加上下文長度並精煉性能:

階段 上下文長度 Token (GT)
Stage 1 2048 4500
Stage 2 4096 250
Stage 3 8192 250
Stage 4 8192 500

資料來源包括 RefinedWeb-English 與 RefinedWeb-Europe,涵蓋十種語言:捷克語 (cs)、德語 (de)、西班牙語 (es)、法語 (fr)、義大利語 (it)、荷蘭語 (nl)、波蘭語 (pl)、葡萄牙語 (pt)、羅馬尼亞語 (ro) 與瑞典語 (sv)。

模型架構與訓練流程

Falcon2-11B 採用基於 Transformer 的架構,具備以下規格:

  • Transformer 區塊: 60
  • 查詢頭(Query Heads): 32
  • 鍵/值頭(Key/Value Heads): 8
  • 頭部維度: 128
  • 平行注意力:
  • MLP 放大因子: 4

訓練在 1,024 顆 A100 40GB GPU 上進行,採用 3D 平行策略 (TP=8, PP=1, DP=128)、ZeRO 與 Flash-Attention 2。模型使用 bfloat16 精度,AdamW 優化器,並在第一階段使用餘弦衰減學習率排程。

Falcon2-11B LLM 效能評估

Falcon2-11B 展示出與更大型模型以及其他 7B-11B 級別模型相當的競爭性能。

英文與通用基準測試

在 Open LLM Leaderboard 任務上,Falcon2-11B 獲得平均分數 64.28,與 Gemma-7B (64.29) 持平,並優於 Llama3-8B (62.38) 與 Mistral-7B (60.97)。值得注意的是,零樣本評估顯示 Falcon2-11B 的表現與遠大於其規模的 Falcon-40B 相近,儘管其體積僅為後者的四分之一。

多語言與程式碼能力

Falcon2-11B 在六種測試語言(德語、西班牙語、法語、義大利語、荷蘭語與羅馬尼亞語)上優於 Falcon-40B 及多個其他多語言模型。於程式碼生成方面,該模型在 HumanEval Python 基準上取得 29.59% 的 pass@1 成績,透過 BigCode Leaderboard 報告。

Falcon2-11B 視覺語言模型(VLM)

Falcon2-11B VLM 擴展了 LLM 的功能,加入影像理解,使使用者能以文字聊天的方式討論視覺內容。

架構與訓練

VLM 結合了預訓練的 CLIP ViT-L/14 視覺編碼器與經聊天微調的 Falcon2-11B 模型。為提升對小物件與細緻特徵的感知,採用了類似 LLaVA-Next 的動態高解析度編碼機制。

訓練分為兩個階段:

  1. Pretraining: 在此階段,LLM 與視覺編碼器保持凍結,僅對多模態投影器進行訓練,使用 558K 張圖像-說明配對,將視覺嵌入映射至文字空間。
  2. Finetuning: 投影器與 LLM 權重同時在 1.2M 張圖像-文字指令資料上進行微調,包含多輪對話。

VLM 評估

Falcon2-11B VLM 在多項視覺基準上表現強勁,平均分數 74.4,超過 LLaVA-1.6 (Vicuna-7B) 的 72.1 以及 LLaVA-1.6 (Mistral-7B) 的 73.3。

模型 MME GQA SQA POPE VQAv2 TextVQA MM-Bench SEED-IMG 平均
Falcon2-11B VLM 1589/343 64.5 74.9 88.4 82.1 66.7 72.0 72.3 74.4
LLaVA-1.6 (Vicuna-7B) 1519/332 64.2 70.1 86.5 81.8 64.9 67.4 70.2 72.1
LLaVA-1.6 (Vicuna-13B) 1575/326 65.4 73.6 86.2 82.8 67.1 70.0 71.9 73.8

授權條款

Falcon 2 系列模型以 TII Falcon 2 License 發布,該授權基於寬鬆的 Apache 2.0,並包含可接受使用政策,以確保 AI 的負責任部署。

Sources