Open FinLLM Leaderboard の開始 – 金融言語モデル向け包括的なゼロショットベンチマーク

TL;DR

Hugging Face が開始した Open FinLLM Leaderboard (OFLL) は、40 のタスクと 7 つのカテゴリにわたる金融言語モデル向けの専用ゼロショット評価スイートを提供し、実際の金融ユースケースに対するモデルの準備状況を透明にベンチマークできるようにします。

Open FinLLM Leaderboard とは

OFLL は、金融専門家にとって重要なタスクに対して大規模言語モデル(LLM)を評価する、公開されたウェブベースのプラットフォームです。汎用NLPリーダーボードがカバーしきれない部分を埋め、情報抽出、感情分析、信用リスクスコアリング、株価変動予測、その他の金融固有機能に焦点を当てています。モデルはタスク固有のファインチューニングなしでテストされるため、結果は真のゼロショット汎化を示します。

主な特徴

  • Task Coverage – 40 の厳選タスクが 7 つのカテゴリにまたがります:情報抽出 (IE)、テキスト分析 (TA)、質問応答 (QA)、テキスト生成 (TG)、リスク管理 (RM)、予測 (FO)、意思決定 (DM)。タスクには NER、因果分類、金融 QA (FinQA、TATQA)、株価変動予測 (BigData22、ACL18、CIKM18)、複数国にわたる信用リスクスコアリング、ESG 問題検出、取引シミュレーションベンチマーク (FinTrade) が含まれます。
  • Real‑World Datasets – 各タスクは、金融分野で公開されているデータセット(例:Financial PhraseBank、FiQA、FOMC ステートメント、FinRED、LendingClub)を使用し、レポーティング、コンプライアンス、取引で専門家が直面するデータを反映しています。
  • Zero‑Shot Evaluation – モデルは未見タスクで評価され、追加のファインチューニングなしで新しい金融コンテキストに汎化できる能力が明らかになります。
  • Multi‑Metric Scoring – パフォーマンスはタスクに適した複数の指標で測定されます:Accuracy、F1‑Score、Entity F1、Exact‑Match Accuracy、RMSE、ROUGE、BERTScore、BARTScore、Matthews Correlation Coefficient (MCC)、取引シミュレーションの Sharpe Ratio。これら多面的な評価により、ユーザーは強みと弱みを特定しやすくなります。

サポートされているタスクと指標(選択例)

カテゴリ 例タスク 説明 主な指標
情報抽出 NER 提出書類中の企業や金融商品などのエンティティを特定する。 Entity F1
FinRED 所有権や取得関係を抽出する。 F1、Entity F1
テキスト分析 FPB / FiQA‑SA / TSA ニュース、レポート、ツイートの感情分類。 Accuracy、F1、RMSE
FOMC 連邦公開市場委員会(FOMC)の声明をタカ派かハト派かに分類する。 Accuracy、F1
質問応答 FinQA バランスシートデータに関する数値質問応答。 Exact‑Match Accuracy
ConvFinQA 複数ターンの金融対話。 Exact‑Match Accuracy
テキスト生成 EDTSUM / ECTSUM 長文レポートの抽出的要約。 ROUGE、BERTScore、BARTScore
予測 BigData22 ニュースから株価の方向性を予測する。 Accuracy、MCC
リスク管理 LendingClub / ccf / ccfraud 信用リスクまたは詐欺検出。 F1、MCC
意思決定 FinTrade シミュレート取引;収益性を評価する。 Sharpe Ratio

リーダーボードの使い方

  1. Select Tasks – “Select columns to show” パネルを使用して、40 のタスクから任意のサブセットを選択します。タスクは 7 つのカテゴリでグループ化されており、簡単にフィルタリングできます。
  2. Filter Models – 右側のフィルタで、モデルタイプ(事前学習、指示チューニング、RLチューニング)、精度(float16、bfloat16、float32)、サイズ(≈1.5 B から >70 B パラメータ)で結果を絞り込めます。
  3. View Results – タスク表は、選択した各タスクに対するモデルごとのスコアを表示し、カテゴリ別平均(例:Average IEAverage TA)に集計します。
  4. Submit a Model – “Submit here” タブをクリックし、モデルのリポジトリ名、コミットハッシュ、タイプ、精度、ウェイト形式を入力します。プラットフォームは全ゼロショットスイートを実行し、リアルタイムで表を更新します。

現在のベストモデルと驚くべき発見

  • Top Performers – GPT‑4 と Llama 3.1 は、特に感情が重視されるタスクで、ほとんどのカテゴリで一貫して最高スコアを達成しています。
  • Size‑Performance Decoupling – 予測 (FO) カテゴリでは、Llama‑3.1‑7Binternlm‑7B といった小型モデルが、はるかに大きな Llama‑3.1‑70B を精度と MCC で上回ります。これは、モデルサイズが時間に敏感な市場予測タスクの成功を決定する唯一の要因ではないことを示唆しています。
  • Implication – 実務者は、より大きく汎用的な LLM がすべての金融ユースケースを支配すると仮定せず、タスク固有のベンチマークを優先すべきです。

謝辞

このリーダーボードは Linux Foundation の一部資金提供を受け、研究者やエンジニアのコミュニティからの貢献により構築されました。プロジェクトは継続的な参加を歓迎しています:新しいモデル、データセット、評価タスクを提出し、ベンチマークを関連性があり包括的なものに保ちましょう。


リーダーボードのライブビューやモデルの提出は、Open FinLLM Leaderboardhttps://huggingface.co/spaces/TheFinAI/Open-Financial-LLM-Leaderboard)をご覧ください。


SUMMARY: Hugging Face は Open FinLLM Leaderboard を開始しました。このゼロショットベンチマークは、7 つのカテゴリにわたる 40 の金融特化タスクをカバーし、実際の金融アプリケーションに対する LLM の準備状況を評価します。

TITLE: Open FinLLM Leaderboard の開始 – 金融言語モデル向け包括的なゼロショットベンチマーク

Sources