Falcon-H1-Arabic 發行說明

Hugging Face 推出了 Falcon-H1-Arabic,這是一個由三個先進的阿拉伯語模型(3B、7B 和 34B 參數)組成的系列,採用混合 Mamba-Transformer 架構,以在阿拉伯語自然語言處理方面達到最先進的表現。此版本大幅擴展了上下文能力,並相較於先前的版本提升了方言理解與推理能力。

混合 Mamba-Transformer 架構

Falcon-H1-Arabic 基於 Falcon-H1 混合架構構建,該架構在每個區塊中平行整合了狀態空間模型(Mamba)與 Transformer 注意力。兩個組件的表示在區塊的輸出投影之前被融合。

此設計結合了 Mamba 在長序列上的線性時間可擴展性與注意力的精確長距離建模。對於阿拉伯語而言,該架構提升了長篇文本的連貫性與推理能力,並能適應其豐富的形態學與彈性的句子結構。

擴展的上下文窗口

Falcon-H1-Arabic 大幅提升了上下文限制,以支援對大型文件(如法律記錄或技術文件)的分析。模型經過特別的後訓練,以減輕「中段遺失」的挑戰,確保能有效利用完整的上下文範圍。

參數 上下文窗口 理想應用
3B 128K 令牌 快速代理、高 QPS 系統、輕量分析
7B 256K 令牌 生產助理、推理、企業聊天
34B 256K 令牌 長文件分析、研究、高風險任務

資料管線與方言多樣性

這些模型在約 3000 億個令牌上進行訓練,內容包含近乎等比例的阿拉伯語、英語與多語言資料,以維持全球推理與 STEM 能力。

資料管線的主要改進包括:

  • 深度語言分析: 團隊將啟發式過濾替換為針對阿拉伯語正字法、形態、變音符號與句法模式量身打造的多階段品質過濾流程。
  • 方言覆蓋: 資料集擴展至涵蓋更廣泛的實際阿拉伯語,包括埃及、黎凡特、海灣與馬格里布方言,降低模型對現代標準阿拉伯語(MSA)的過度依賴。

後訓練與對齊

Falcon-H1-Arabic 經歷兩階段的後訓練流程,以精煉其能力而不損害核心競爭力:

  1. 監督式微調 (SFT): 模型接受高品質的阿拉伯語指令與精選的長上下文範例,以教導它們遵循指示並根據提供的資訊產生回應。
  2. 直接偏好優化 (DPO): 此階段精練對齊與對話品質,減少如漂移或忽略對話中早期資訊等失敗模式。

基準表現

Falcon-H1-Arabic 在多項關鍵基準上達到最先進的結果,常常超越規模顯著更大的模型。

Open Arabic LLM Leaderboard (OALL)

  • 3B Model: 約達 62%,較 Gemma-4B、Qwen3-4B 與 Phi-4-mini 等小規模模型高出約十個百分點。
  • 7B Model: 獲得 71.7%,超越約 10B 類別的模型,包括 Fanar-9B 與 Qwen3-8B。
  • 34B Model: 約達 75%,優於更大型系統如 Llama-3.3-70B 與 AceGPT2-32B。

專門基準

  • 3LM (STEM): 34B 模型在原生分割上約達 96%,在合成分割上約 94%。
  • ArabCulture: 34B 模型得分接近 80%。
  • AraDice (Dialects): 34B 模型在各種方言上約為 53%。

部署情境

  • 3B Model: 為邊緣部署、即時應用與代理系統(對延遲與成本敏感)進行最佳化。
  • 7B Model: 設計為通用工作馬,適用於生產聊天機器人、摘要流程與內容生成。
  • 34B Model: 針對需要最高精度與長距離推理的高風險領域,如醫療摘要與法律分析。

Sources