Falcon-H1-Arabic 發行說明
Hugging Face 推出了 Falcon-H1-Arabic,這是一個由三個先進的阿拉伯語模型(3B、7B 和 34B 參數)組成的系列,採用混合 Mamba-Transformer 架構,以在阿拉伯語自然語言處理方面達到最先進的表現。此版本大幅擴展了上下文能力,並相較於先前的版本提升了方言理解與推理能力。
混合 Mamba-Transformer 架構
Falcon-H1-Arabic 基於 Falcon-H1 混合架構構建,該架構在每個區塊中平行整合了狀態空間模型(Mamba)與 Transformer 注意力。兩個組件的表示在區塊的輸出投影之前被融合。
此設計結合了 Mamba 在長序列上的線性時間可擴展性與注意力的精確長距離建模。對於阿拉伯語而言,該架構提升了長篇文本的連貫性與推理能力,並能適應其豐富的形態學與彈性的句子結構。
擴展的上下文窗口
Falcon-H1-Arabic 大幅提升了上下文限制,以支援對大型文件(如法律記錄或技術文件)的分析。模型經過特別的後訓練,以減輕「中段遺失」的挑戰,確保能有效利用完整的上下文範圍。
| 參數 | 上下文窗口 | 理想應用 |
|---|---|---|
| 3B | 128K 令牌 | 快速代理、高 QPS 系統、輕量分析 |
| 7B | 256K 令牌 | 生產助理、推理、企業聊天 |
| 34B | 256K 令牌 | 長文件分析、研究、高風險任務 |
資料管線與方言多樣性
這些模型在約 3000 億個令牌上進行訓練,內容包含近乎等比例的阿拉伯語、英語與多語言資料,以維持全球推理與 STEM 能力。
資料管線的主要改進包括:
- 深度語言分析: 團隊將啟發式過濾替換為針對阿拉伯語正字法、形態、變音符號與句法模式量身打造的多階段品質過濾流程。
- 方言覆蓋: 資料集擴展至涵蓋更廣泛的實際阿拉伯語,包括埃及、黎凡特、海灣與馬格里布方言,降低模型對現代標準阿拉伯語(MSA)的過度依賴。
後訓練與對齊
Falcon-H1-Arabic 經歷兩階段的後訓練流程,以精煉其能力而不損害核心競爭力:
- 監督式微調 (SFT): 模型接受高品質的阿拉伯語指令與精選的長上下文範例,以教導它們遵循指示並根據提供的資訊產生回應。
- 直接偏好優化 (DPO): 此階段精練對齊與對話品質,減少如漂移或忽略對話中早期資訊等失敗模式。
基準表現
Falcon-H1-Arabic 在多項關鍵基準上達到最先進的結果,常常超越規模顯著更大的模型。
Open Arabic LLM Leaderboard (OALL)
- 3B Model: 約達 62%,較 Gemma-4B、Qwen3-4B 與 Phi-4-mini 等小規模模型高出約十個百分點。
- 7B Model: 獲得 71.7%,超越約 10B 類別的模型,包括 Fanar-9B 與 Qwen3-8B。
- 34B Model: 約達 75%,優於更大型系統如 Llama-3.3-70B 與 AceGPT2-32B。
專門基準
- 3LM (STEM): 34B 模型在原生分割上約達 96%,在合成分割上約 94%。
- ArabCulture: 34B 模型得分接近 80%。
- AraDice (Dialects): 34B 模型在各種方言上約為 53%。
部署情境
- 3B Model: 為邊緣部署、即時應用與代理系統(對延遲與成本敏感)進行最佳化。
- 7B Model: 設計為通用工作馬,適用於生產聊天機器人、摘要流程與內容生成。
- 34B Model: 針對需要最高精度與長距離推理的高風險領域,如醫療摘要與法律分析。