Falcon-H1:混合頭語言模型的效率與效能
Hugging Face 與 TII UAE 已發布 Falcon-H1 系列,這是一個由六款開源語言模型組成的家族,參數規模從 0.5B 到 34B 不等。透過在混合架構中結合傳統的基於 Transformer 的注意力機制與 Mamba-2 狀態空間模型(SSM),Falcon-H1 能夠達到與更大型 Transformer 模型相當的效能,同時顯著提升推理速度與記憶體效率,尤其在長上下文長度下表現更佳。
混合架構:結合注意力與 SSM
Falcon-H1 採用平行混合混音器區塊,將注意力與 Mamba-2 頭部結合。此設計允許注意力與 SSM 頭部的比例獨立調整,使得僅需相對較小比例的注意力即可達到高效能的配置。
關鍵的架構優化包括:
- SSM 參數: 基於 Mamba-2 架構,模型使用更大的記憶體大小以提升效能,且效率成本極低。
- 注意力參數: 模型採用標準的全注意力層,但在旋轉位置嵌入(RoPE)中使用極大規模的參數以提升效能,因為 SSM 組件本身已處理部分位置資訊。
- 深度與寬度: 增加模型深度被發現對效能影響最大。這促成了 Falcon-H1-1.5B-Deep 變體的誕生,該變體在較小參數量下優化至最大效能。
模型規模與能力
Falcon-H1 提供六種規模,每種都有基礎版與指令微調版,並以寬鬆的 Apache 2.0 為基礎的授權釋出:
- 0.5B
- 1.5B
- 1.5B-Deep
- 3B
- 7B
- 34B
效能基準
Falcon-H1 模型的設計目標是匹配或超越至少是其兩倍規模的模型效能。具體而言,Falcon-H1-0.5B 的表現與 2024 年常見的 7B 模型相當,而 Falcon-H1-1.5B-Deep 可與領先的 7B–10B 模型相抗衡。
多語言與 STEM 支援
- 多語言能力: 模型原生支援 18 種語言(包括阿拉伯語、中文、英語、法語、德語、日語、韓語、俄語與西班牙語),並可透過多樣的多語言分詞器擴展至超過 100 種語言。
- STEM: 在訓練過程中優先使用高品質的 STEM 資料,以確保在數學與科學領域具備強大能力。
- 上下文窗口: 該系列支援最高 256K 令牌的上下文長度,便利長文件處理與多輪對話。
訓練策略與動態
Falcon-H1 的開發脫離了標準 Transformer 訓練慣例,以優化混合架構。
資料策略
與傳統的課程學習相反,Falcon-H1 採用了從訓練初期即引入複雜資料(如高階數學與長上下文樣本)的策略,使模型有更多時間學習複雜任務的關鍵特徵。此外,團隊使用「記憶窗口」估計,以更頻繁地重複使用高品質樣本,且不損害泛化能力。
客製化最大更新參數化(μP)
為了在六種模型規模間實現高效擴展,團隊使用了 μP 超參數轉移。他們在傳統 μP 基礎上進行改進,將模型參數劃分為 35 個細粒度群組,並在基礎模型尺寸上共同優化各自的乘數,而非假設乘數為 1 的簡單情況。
穩定性與噪聲控制
為了解決 SSM 基礎模型常見的訓練波動,團隊在 SSM 區塊內實施了抑制 μP 乘數的機制。他們亦將權重衰減整合至訓練排程與 μP 乘數中,以更好地控制參數範數。
推理效率與吞吐量
Falcon-H1 在上下文長度增長時,顯示出相較於純 Transformer 模型的顯著可擴展性優勢。與 Qwen2.5-32B 相比,Falcon-H1 在較長序列長度下可達到 4 倍的輸入吞吐量加速(預填)以及 8 倍的輸出吞吐量加速(生成)。
儘管純 Transformer 在極短上下文長度下可能因目前推理管線中更成熟的注意力優化而稍快,但隨著序列長度的增長,混合架構的效率將佔據主導。