Falcon-Arabic: アラビア語言語モデルの画期的進歩

Technology Innovation Institute(TII)は、Falcon-Arabicという7Bパラメータの言語モデルを導入しました。このモデルは、アラビア語自然言語処理(NLP)の新たな性能ベンチマークを確立します。Falcon 3アーキテクチャを適応させることで、アラビア語の文法、数学的推論、方言理解において最先端の能力を提供し、サイズが最大4倍のモデルを上回ります。

技術アーキテクチャとトレーニングレシピ

Falcon-Arabicは、Falcon 3-7B多言語基盤を適応させて開発され、ゼロからのトレーニングは行われませんでした。このアプローチは、適応型および多言語モデルがOpen Arabic LLM Leaderboardで一貫して高い効率性と能力を示しているため選択されました。

トークナイザーと埋め込みの適応

Falcon 3-7Bはトークナイザーと埋め込みレベルでアラビア語のネイティブサポートが欠如していたため、TIIは主に2つの変更を実装しました:

  • Vocabulary Expansion: トークナイザーに32,000のアラビア語固有トークンが追加されました。
  • Similarity-Based Initialization: テキスト類似性に基づく新しい埋め込み初期化戦略が使用され、新しいアラビア語トークンを既存語彙の意味的に関連する埋め込みにマッピングしました。これにより、モデルは推論パターンや抽象概念に関する事前知識を継承できます。

事前学習カリキュラム

モデルは、機械翻訳コンテンツによってしばしば導入される文化的バイアスを回避するため、100%ネイティブアラビア語データセットを使用して継続的に事前学習を行いました。トレーニングは多段階カリキュラムに従いました:

  1. Initial Stage: 一般知識と方言が豊富なアラビア語コンテンツに焦点を当て、モデルを安定化させました。
  2. Later Stages: 数学的推論、コーディング、複雑な問題解決を強調しました。

パフォーマンスベンチマーク

Falcon-Arabicは、OALL v2(Open Arabic LLM Leaderboard)を使用して評価されました。このリーダーボードは、6つの選択式タスク(Arabic MMLU native と translated、Arabic Exams、Alghafa、MadinahQA、Aratrust)と1つの生成ベンチマーク(Alrage)で構成されています。

ベースモデルのパフォーマンス

Falcon-Arabic-7B-Baseは、Arabic MMLU、Exams、MadinahQA、Aratrustなど、いくつかの主要ベンチマークでリードしています。同サイズカテゴリの既存のすべてのアラビア語LLMを上回り、最大4倍大きいモデルを超えています。

インストラクトモデルのパフォーマンス

事前学習の後、モデルはポストトレーニングアラインメントを経てFalcon-Arabic-7B-Instructを作成しました。このプロセスには以下が含まれます:

  • Supervised Fine-Tuning (SFT): 高品質な公開データセットと社内で収集したネイティブアラビア語指示データを活用。
  • Direct Preference Optimization (DPO): 安全性、関連性、有用性に関して人間の好みと出力を合わせるために使用される強化学習手法。

Falcon-Arabic Instructは、同サイズクラスの他のインストラクト対応アラビア語LLMをすべて上回り、指示に従う能力とオープンエンド対話において、はるかに大きなモデルの性能を超えています。

機能と応用

Falcon-Arabicは32,000トークンのコンテキスト長をサポートし、知識集約型タスクや長文処理に適しています。主な機能は以下の通りです:

  • Retrieval-Augmented Generation (RAG): 根拠のある回答のために長いコンテキストを処理。
  • Multilingualism: アラビア語、英語、その他複数の言語をサポート。
  • Dialectal Understanding: 現代標準アラビア語(MSA)とさまざまな地域方言の両方に流暢。
  • Zero-Shot Translation: 特定のファインチューニングは行われていないにもかかわらず、強力な機械翻訳能力を示します。

制限事項

  • Hallucinations: もっともらしいが誤った情報を生成する可能性。
  • Prompt Sensitivity: プロンプトの表現方法に応じた性能の変動。
  • Context Length: 非常に長いコンテキストを処理する際の性能変動。

Sources