Falcon-H1: 効率と性能のためのハイブリッドヘッド言語モデル

Hugging Face と TII UAE は、Falcon-H1 シリーズをリリースしました。これは 0.5B から 34B パラメータまでの 6 つのオープンソース言語モデルのファミリーです。古典的な Transformer ベースのアテンションと Mamba-2 状態空間モデル(SSM)をハイブリッドアーキテクチャで組み合わせることで、Falcon-H1 は大規模な Transformer ベースモデルに匹敵する性能を実現しつつ、特に長いコンテキスト長での推論速度とメモリ効率を大幅に向上させます。

ハイブリッドアーキテクチャ: アテンションとSSMの組み合わせ

Falcon-H1 は、アテンションと Mamba-2 ヘッドを統合した並列ハイブリッドミキサーブロックを利用します。この設計により、アテンションと SSM ヘッドの比率を独立して調整でき、比較的少量のアテンションで高性能を実現できる構成が可能になります。

主なアーキテクチャ最適化は以下の通りです:

  • SSM パラメータ: Mamba-2 アーキテクチャに基づき、モデルはパフォーマンスを向上させるために大きなメモリサイズを利用し、効率コストは最小限です。
  • アテンション パラメータ: モデルは標準的なフルアテンション層を使用しますが、回転位置埋め込み (RoPE) に極めて大規模なパラメータを使用して性能を向上させます。SSM コンポーネントは一部の位置情報を自然に処理します。
  • 深さ vs. 幅: モデルの深さを増やすことが性能に最も大きな影響を与えることが判明しました。これにより、Falcon-H1-1.5B-Deep バリアントが作成され、少ないパラメータ数で最大性能を最適化します。

モデル規模と機能

Falcon-H1 は 6 つのサイズで提供され、ベースと指示チューニングのバリアントがあり、Apache 2.0 ベースの許可的ライセンスの下でリリースされています:

  • 0.5B
  • 1.5B
  • 1.5B-Deep
  • 3B
  • 7B
  • 34B

パフォーマンスベンチマーク

Falcon-H1 モデルは、少なくともサイズの2倍のモデルと同等またはそれ以上の性能を目指して設計されています。具体的には、Falcon-H1-0.5B は 2024 年の典型的な 7B モデルと同等の性能を示し、Falcon-H1-1.5B-Deep は主要な 7B–10B モデルに匹敵します。

多言語とSTEMサポート

  • 多言語対応: モデルは 18 の言語(アラビア語、中国語、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、スペイン語など)をネイティブにサポートし、多様な多言語トークナイザーにより 100 以上の言語に拡張可能です。
  • STEM: 訓練時に高品質な STEM データを優先し、数学と科学における強力な能力を確保しました。
  • コンテキストウィンドウ: シリーズは最大 256K トークンのコンテキスト長をサポートし、長文処理やマルチターン対話を容易にします。

訓練戦略とダイナミクス

Falcon-H1 の開発は、ハイブリッドアーキテクチャを最適化するために、標準的な Transformer 訓練慣行からの逸脱を伴いました。

データ戦略

従来のカリキュラム学習とは異なり、Falcon-H1 は訓練開始時から複雑なデータ(高度な数学や長コンテキストサンプルなど)を導入し、複雑タスクに必要な特徴を学習する時間を増やしました。また、チームは「記憶ウィンドウ」推定を利用し、高品質サンプルをより頻繁に再利用し、汎化を損なわないようにしました。

カスタマイズされた最大更新パラメータ化 (μP)

6 つのモデルサイズ全体で効率的にスケールできるよう、チームは μP ハイパーパラメータ転送を使用しました。従来の μP を改良し、モデルパラメータを 35 の細分化されたグループに分割し、ベースモデルサイズでそれぞれの乗数を共同最適化しました。

安定性とノイズ制御

SSM ベースのモデルで一般的な訓練スパイクを解決するため、チームは SSM ブロック内の μP 乗数に減衰を実装しました。また、パラメータノルムをより良く制御するために、訓練スケジュールと μP 乗数の両方に weight decay を統合しました。

推論効率とスループット

Falcon-H1 は、コンテキスト長が増加するにつれて、純粋な Transformer モデルに対して大幅なスケーラビリティの利点を示します。Qwen2.5-32B と比較した場合、長いシーケンス長で 入力スループット(prefill)で最大 4 倍の速度向上出力スループット(生成)で最大 8 倍の速度向上 を達成します。

純粋な Transformer は、現在の推論パイプラインでのアテンション最適化が成熟しているため、非常に短いコンテキスト長では若干速い場合がありますが、シーケンス長が長くなるにつれてハイブリッドアーキテクチャの効率が支配的になります。

Sources