Falcon-H1-Arabic リリースノート

Hugging FaceはFalcon-H1-Arabicを導入しました。これは3つの高度なアラビア語モデル(3B、7B、34Bパラメータ)からなるファミリーで、ハイブリッド Mamba-Transformer アーキテクチャを利用し、アラビア語自然言語処理において最先端の性能を実現します。このリリースは、コンテキスト能力を大幅に拡張し、従来のバージョンに比べて方言理解と推論を向上させます。

ハイブリッド Mamba-Transformer アーキテクチャ

Falcon-H1-ArabicはFalcon-H1ハイブリッドアーキテクチャ上に構築されており、各ブロック内で状態空間モデル(Mamba)とTransformer アテンションを並列に統合しています。両コンポーネントからの表現はブロックの出力射影の前に融合されます。

この設計は、長シーケンスに対する線形時間スケーラビリティを持つMambaと、注意機構の正確な長距離モデリングを組み合わせます。アラビア語に対しては、豊かな形態論と柔軟な文構造を考慮し、拡張テキスト全体での一貫性と推論を改善します。

拡張されたコンテキストウィンドウ

Falcon-H1-Arabicは、法的記録や技術文書などの大規模文書の分析をサポートするために、コンテキスト上限を劇的に拡大しました。モデルは「途中で失われる」課題を緩和するように特別にポストトレーニングされており、全コンテキスト範囲を効果的に活用できます。

パラメータ コンテキストウィンドウ 理想的な使用例
3B 128K トークン 高速エージェント、高QPSシステム、軽量分析
7B 256K トークン プロダクションアシスタント、推論、エンタープライズチャット
34B 256K トークン 長文書分析、研究、ハイステークスタスク

データパイプラインと方言の多様性

モデルは約3000億トークンで学習されており、アラビア語、英語、多言語コンテンツがほぼ同等に混在しています。これにより、グローバルな推論とSTEM能力が維持されます。

データパイプラインの主な改善点は次のとおりです。

  • 深層言語分析: ヒューリスティックフィルタリングを廃止し、アラビア語の正字法、形態論、母音記号、構文パターンに特化したマルチステージ品質フィルタリングプロセスを導入しました。
  • 方言カバレッジ: データセットを拡張し、エジプト、レバント、湾岸、マグレブ方言など、実世界のアラビア語の幅広いスペクトルを含め、モデルが現代標準アラビア語(MSA)に過度に依存することを減少させました。

ポストトレーニングとアラインメント

Falcon-H1-Arabicは、コアコンピテンスを損なうことなく能力を洗練させる二段階ポストトレーニングプロセスを経ます。

  1. 教師ありファインチューニング (SFT): 高品質なアラビア語指示とキュレーションされた長コンテキスト例にモデルを曝露し、指示に従い提供情報に基づいた応答を生成できるようにします。
  2. 直接嗜好最適化 (DPO): アラインメントと対話品質を改善し、会話中のドリフトや初期情報の無視といった失敗モードを削減します。

ベンチマーク性能

Falcon-H1-Arabicは複数の主要ベンチマークで最先端の結果を達成し、しばしばはるかに大きなサイズのモデルを上回ります。

Open Arabic LLM Leaderboard (OALL)

  • 3B モデル: 約62%に達し、Gemma-4B、Qwen3-4B、Phi-4-mini などの小規模モデルを約10ポイント上回ります。
  • 7B モデル: 71.7%のスコアで、Fanar-9B、Qwen3-8B を含む~10Bクラスのモデルを上回ります。
  • 34B モデル: 約75%に達し、Llama-3.3-70B、AceGPT2-32B などの大規模システムを上回ります。

専門ベンチマーク

  • 3LM (STEM): 34Bモデルはネイティブ分割で約96%、合成分割で94%に達します。
  • ArabCulture: 34Bモデルは約80%のスコアです。
  • AraDice (方言): 34Bモデルはさまざまな方言で約53のスコアです。

導入シナリオ

  • 3B モデル: エッジ展開、リアルタイムアプリケーション、レイテンシとコストが重要なエージェントシステム向けに最適化。
  • 7B モデル: プロダクションチャットボット、要約パイプライン、コンテンツ生成の汎用ワークホースとして設計。
  • 34B モデル: 医療要約や法的分析など、最大精度と長距離推論が求められるハイステークス領域を対象。

Sources