Falcon 2 11B リリースノート

TIIはFalcon 2を発表しました。これは、11Bパラメータの大規模言語モデル(LLM)と対応するビジョン・ランゲージモデル(VLM)を備えた新世代のオープンソースモデルです。これらのモデルは、コミュニティに対して、推論コストを削減しつつ、複数言語とモダリティにわたる高い性能を維持する、より小型で効率的なモデルを提供することを目的としています。

Falcon2-11B LLM 技術仕様

Falcon2-11Bは、RefinedWebデータの5,000億トークン以上で事前学習された言語モデルで、技術データ、コード、対話データを含むキュレーションされたコーパスで補完されています。

トレーニング戦略とデータ

モデルは、コンテキスト長を段階的に拡大し、性能を洗練させるための4段階戦略でトレーニングされました。

ステージ コンテキスト長 トークン (GT)
Stage 1 2048 4500
Stage 2 4096 250
Stage 3 8192 250
Stage 4 8192 500

データソースにはRefinedWeb-EnglishとRefinedWeb-Europeが含まれ、以下の10言語をカバーしています:チェコ語 (cs)、ドイツ語 (de)、スペイン語 (es)、フランス語 (fr)、イタリア語 (it)、オランダ語 (nl)、ポーランド語 (pl)、ポルトガル語 (pt)、ルーマニア語 (ro)、スウェーデン語 (sv)。

モデルアーキテクチャとトレーニング手順

Falcon2-11Bは、以下の仕様を持つTransformerベースのアーキテクチャを採用しています。

  • Transformer ブロック: 60
  • クエリヘッド: 32
  • キー/バリューヘッド: 8
  • ヘッド次元: 128
  • 並列注意: Yes
  • MLP アップスケール係数: 4

トレーニングは、1,024台のA100 40GB GPUを使用し、3D並列戦略(TP=8、PP=1、DP=128)とZeRO、Flash-Attention 2で実施されました。モデルはbfloat16精度で、最初のステージではAdamWオプティマイザとコサイン減衰学習率スケジュールが使用されました。

Falcon2-11B LLM パフォーマンス評価

Falcon2-11Bは、より大規模なモデルや他の7B〜11Bクラスのモデルと比較して競争力のある性能を示します。

英語および一般ベンチマーク

Open LLM Leaderboardタスクにおいて、Falcon2-11Bは平均スコア64.28を取得し、Gemma-7B(64.29)と同等で、Llama3-8B(62.38)やMistral-7B(60.97)を上回っています。特にゼロショット評価では、Falcon2-11Bはサイズが4倍小さいにもかかわらず、はるかに大きなFalcon-40Bに匹敵する性能を示しています。

多言語およびコーディング機能

Falcon2-11Bは、ドイツ語、スペイン語、フランス語、イタリア語、オランダ語、ルーマニア語の6言語にわたってFalcon-40Bや他の多言語モデルを上回ります。コード生成においては、HumanEvalベンチマークでPythonのpass@1が29.59%に達しました(BigCode Leaderboard経由)。

Falcon2-11B ビジョン・ランゲージモデル (VLM)

Falcon2-11B VLMは、LLMの機能を画像理解に拡張し、ユーザーが視覚コンテンツについてテキストベースのチャットを行えるようにします。

アーキテクチャとトレーニング

VLMは、事前学習済みCLIP ViT-L/14ビジョンエンコーダと、チャットファインチューニングされたFalcon2-11Bモデルを統合しています。小さなオブジェクトや細部の認識を向上させるため、LLaVA-Nextに類似した動的高解像度エンコーディング機構を採用しています。

トレーニングは2段階で行われました:

  1. 事前学習: LLMとビジュアルエンコーダは凍結されたままで、マルチモーダルプロジェクタが558Kの画像‑キャプションペア上で視覚埋め込みをテキスト空間にマッピングするように学習されました。
  2. ファインチューニング: プロジェクタとLLMの重みが、1.2Mの画像‑テキスト指示データ(複数ラウンドの対話を含む)上で共同学習されました。

VLM 評価

Falcon2-11B VLMは、複数のビジョンベンチマークで強力な性能を示し、平均スコア74.4を達成しました。これは、LLaVA-1.6(Vicuna-7B)の72.1やLLaVA-1.6(Mistral-7B)の73.3を上回ります。

モデル MME GQA SQA POPE VQAv2 TextVQA MM-Bench SEED-IMG 平均
Falcon2-11B VLM 1589/343 64.5 74.9 88.4 82.1 66.7 72.0 72.3 74.4
LLaVA-1.6 (Vicuna-7B) 1519/332 64.2 70.1 86.5 81.8 64.9 67.4 70.2 72.1
LLaVA-1.6 (Vicuna-13B) 1575/326 65.4 73.6 86.2 82.8 67.1 70.0 71.9 73.8

ライセンス

Falcon 2モデルは、TII Falcon 2 Licenseの下でリリースされます。これは、Apache 2.0ベースの許容的なライセンスであり、責任あるAI展開を確保するための許容使用ポリシーを含んでいます。

Sources