Open FinLLM Leaderboard 發布 – 全面零樣本金融語言模型基準測試

TL;DR

The Open FinLLM Leaderboard (OFLL) launched by Hugging Face provides a dedicated, zero‑shot evaluation suite for financial language models across 40 tasks and seven categories, enabling transparent benchmarking of model readiness for real‑world finance use cases.

Open FinLLM Leaderboard 是什麼

The OFLL is a public, web‑based platform that evaluates large language models (LLMs) on tasks that matter to finance professionals. It fills the gap left by general‑purpose NLP leaderboards by focusing on information extraction, sentiment analysis, credit risk scoring, stock‑movement forecasting, and other finance‑specific capabilities. Models are tested without any task‑specific fine‑tuning, so the results reflect true zero‑shot generalisation.

主要特點

  • 任務覆蓋 – 40 個精選任務涵蓋七大類別:資訊抽取 (IE)、文本分析 (TA)、問答 (QA)、文本生成 (TG)、風險管理 (RM)、預測 (FO) 與決策制定 (DM)。這些任務包括 NER、因果分類、金融問答 (FinQA、TATQA)、股價走勢預測 (BigData22、ACL18、CIKM18)、跨多國的信用風險評分、ESG 議題偵測,以及交易模擬基準 (FinTrade)。
  • 真實世界資料集 – 每個任務皆使用公開的金融資料集(例如 Financial PhraseBank、FiQA、FOMC 聲明、FinRED、LendingClub),這些資料與專業人士在報告、合規與交易中所面臨的資料相符。
  • 零樣本評估 – 模型在未見過的任務上進行評估,顯示其在不進行額外微調的情況下,對新金融情境的泛化能力。
  • 多指標評分 – 依據每項任務的特性,使用多種指標衡量表現:Accuracy、F1‑Score、Entity F1、Exact‑Match Accuracy、RMSE、ROUGE、BERTScore、BARTScore、Matthews Correlation Coefficient(MCC)以及交易模擬的 Sharpe Ratio。此多維度的觀點協助使用者找出模型的優勢與不足。

支援的任務與指標(選取範例)

類別 範例任務 說明 主要指標
資訊抽取 NER 辨識文件中如公司與金融工具等實體。 Entity F1
FinRED 抽取所有權或收購關係。 F1, Entity F1
文本分析 FPB / FiQA‑SA / TSA 對新聞、報告或推文進行情感分類。 Accuracy, F1, RMSE
FOMC 將聯邦公開市場委員會聲明分類為鷹派或鴿派。 Accuracy, F1
問答 FinQA 針對資產負債表數據進行數值問答。 Exact‑Match Accuracy
ConvFinQA 多輪金融對話。 Exact‑Match Accuracy
文本生成 EDTSUM / ECTSUM 對長篇報告進行抽取式摘要。 ROUGE, BERTScore, BARTScore
預測 BigData22 根據新聞預測股票走向。 Accuracy, MCC
風險管理 LendingClub / ccf / ccfraud 信用風險或詐騙偵測。 F1, MCC
決策制定 FinTrade 模擬交易;評估獲利能力。 Sharpe Ratio

如何使用排行榜

  1. 選擇任務 – 使用「Select columns to show」面板挑選任意子集的 40 個任務。任務依七大類別分組,便於快速篩選。
  2. 篩選模型 – 右側過濾器可依模型類型(預訓練、指令微調、RL 微調)、精度(float16、bfloat16、float32)以及規模(≈1.5 B 至 >70 B 參數)縮小結果。
  3. 檢視結果 – 任務表格顯示每個模型在所選任務上的分數,並彙總為各類別的平均值(例如 Average IEAverage TA)。
  4. 提交模型 – 點擊「Submit here」標籤,提供模型倉庫名稱、提交雜湊、類型、精度與權重格式。平台將執行完整的零樣本測試套件,並即時更新表格。

目前最佳模型與驚人發現

  • 最佳表現者 – GPT‑4 與 Llama 3.1 在大多數類別中持續取得最高分,尤其在情感密集的任務上。
  • 規模與效能脫鉤 – 在預測 (FO) 類別中,較小的模型如 Llama‑3.1‑7Binternlm‑7B 在 Accuracy 與 MCC 上超過了更大的 Llama‑3.1‑70B。這顯示模型規模並非時間敏感的市場預測任務成功的唯一指標。
  • 啟示 – 實務工作者應優先進行任務特定的基準測試,而非假設較大、通用的 LLM 會在所有金融應用中占優。

感謝

The leaderboard is funded in part by The Linux Foundation and built with contributions from a community of researchers and engineers. The project invites ongoing participation: submit new models, datasets, or evaluation tasks to keep the benchmark relevant and comprehensive.


欲即時檢視排行榜並提交您的模型,請前往 Open FinLLM Leaderboard https://huggingface.co/spaces/TheFinAI/Open-Financial-LLM-Leaderboard.

Sources