Open FinLLM Leaderboard 发布 – 金融语言模型的全面零样本基准
TL;DR
The Open FinLLM Leaderboard (OFLL) launched by Hugging Face provides a dedicated, zero‑shot evaluation suite for financial language models across 40 tasks and seven categories, enabling transparent benchmarking of model readiness for real‑world finance use cases.
Open FinLLM Leaderboard 是什么
The OFLL is a public, web‑based platform that evaluates large language models (LLMs) on tasks that matter to finance professionals. It fills the gap left by general‑purpose NLP leaderboards by focusing on information extraction, sentiment analysis, credit risk scoring, stock‑movement forecasting, and other finance‑specific capabilities. Models are tested without any task‑specific fine‑tuning, so the results reflect true zero‑shot generalisation.
关键特性
- Task Coverage – 40 项精心挑选的任务覆盖七大类:信息抽取 (IE)、文本分析 (TA)、问答 (QA)、文本生成 (TG)、风险管理 (RM)、预测 (FO) 和决策 (DM)。任务包括 NER、因果分类、金融问答 (FinQA, TATQA)、股票走势预测 (BigData22, ACL18, CIKM18)、跨多国的信用风险评分、ESG 议题检测以及交易模拟基准 (FinTrade)。
- Real‑World Datasets – 每项任务使用公开的金融数据集(例如 Financial PhraseBank、FiQA、FOMC 声明、FinRED、LendingClub),这些数据集与专业人士在报告、合规和交易中遇到的数据相吻合。
- Zero‑Shot Evaluation – 模型在未见过的任务上进行评估,展示其在无需额外微调的情况下对新金融情境的泛化能力。
- Multi‑Metric Scoring – 性能通过一套适用于各任务的指标进行衡量:Accuracy、F1‑Score、Entity F1、Exact‑Match Accuracy、RMSE、ROUGE、BERTScore、BARTScore、Matthews Correlation Coefficient (MCC) 以及交易模拟的 Sharpe Ratio。此多维视角帮助用户精准定位模型的优势与不足。
支持的任务与指标(精选示例)
| 类别 | 示例任务 | 描述 | 主要指标 |
|---|---|---|---|
| 信息抽取 | NER | 识别文件中公司和金融工具等实体。 | Entity F1 |
| FinRED | 抽取所有权或收购关系。 | F1, Entity F1 | |
| 文本分析 | FPB / FiQA‑SA / TSA | 对新闻、报告或推文进行情感分类。 | Accuracy, F1, RMSE |
| FOMC | 将美联储公开市场委员会声明分类为鹰派或鸽派。 | Accuracy, F1 | |
| 问答 | FinQA | 对资产负债表数据进行数值问答。 | Exact‑Match Accuracy |
| ConvFinQA | 多轮金融对话。 | Exact‑Match Accuracy | |
| 文本生成 | EDTSUM / ECTSUM | 对长篇报告进行抽取式摘要。 | ROUGE, BERTScore, BARTScore |
| 预测 | BigData22 | 根据新闻预测股票走势。 | Accuracy, MCC |
| 风险管理 | LendingClub / ccf / ccfraud | 信用风险或欺诈检测。 | F1, MCC |
| 决策 | FinTrade | 模拟交易;评估盈利能力。 | Sharpe Ratio |
如何使用排行榜
- Select Tasks – 使用“Select columns to show”面板选择任意子集的 40 项任务。任务按七大类分组,便于快速筛选。
- Filter Models – 右侧过滤器可按模型类型(预训练、指令微调、RL 微调)、精度(float16、bfloat16、float32)和规模(≈1.5 B 至 >70 B 参数)缩小结果范围。
- View Results – 任务表展示每个模型在所选任务上的得分,并汇总为各类别的平均值(例如 Average IE、Average TA)。
- Submit a Model – 点击“Submit here”标签页,提供模型仓库名称、提交哈希、类型、精度和权重格式。平台随后运行完整的零样本套件,并实时更新表格。
当前最佳模型与惊人发现
- Top Performers – GPT‑4 和 Llama 3.1 在大多数类别中持续取得最高分,尤其在情感密集的任务上。
- Size‑Performance Decoupling – 在预测 (FO) 类别中,较小模型如 Llama‑3.1‑7B 和 internlm‑7B 在准确率和 MCC 上超越了体积更大的 Llama‑3.1‑70B。这表明模型规模并非时间敏感的市场预测任务成功的唯一指标。
- Implication – 实践者应优先进行任务特定的基准测试,而不是假设更大、通用的 LLM 会在所有金融场景中占优势。
致谢
The leaderboard is funded in part by The Linux Foundation and built with contributions from a community of researchers and engineers. The project invites ongoing participation: submit new models, datasets, or evaluation tasks to keep the benchmark relevant and comprehensive.
要实时查看排行榜并提交自己的模型,请访问 Open FinLLM Leaderboard https://huggingface.co/spaces/TheFinAI/Open-Financial-LLM-Leaderboard。