Open FinLLM 리더보드 출시 – 금융 언어 모델을 위한 포괄적인 제로샷 벤치마크

TL;DR

Hugging Face가 출시한 Open FinLLM Leaderboard(OFLL)는 40개의 과제와 7개의 카테고리에 걸친 금융 전용 제로샷 평가 스위트를 제공하여 실제 금융 활용 사례에 대한 모델 준비도를 투명하게 벤치마킹할 수 있게 합니다.

Open FinLLM Leaderboard가 무엇인가

OFLL은 금융 전문가에게 중요한 과제들을 평가하는 공개 웹 기반 플랫폼입니다. 일반 NLP 리더보드가 남긴 공백을 메우며 정보 추출, 감성 분석, 신용 위험 점수화, 주가 움직임 예측 및 기타 금융 특화 기능에 초점을 맞춥니다. 모델은 과제별 파인튜닝 없이 테스트되므로 결과는 진정한 제로샷 일반화를 반영합니다.

주요 특징

  • 과제 범위 – 40개의 선별된 과제는 정보 추출(IE), 텍스트 분석(TA), 질문 응답(QA), 텍스트 생성(TG), 위험 관리(RM), 예측(FO), 의사결정(DM) 등 일곱 카테고리로 구성됩니다. 과제에는 NER, 인과 분류, 금융 QA(FinQA, TATQA), 주가 움직임 예측(BigData22, ACL18, CIKM18), 다국가 신용 위험 점수화, ESG 이슈 탐지, 그리고 트레이딩 시뮬레이션 벤치마크(FinTrade)가 포함됩니다.
  • 실제 데이터셋 – 각 과제는 공개된 금융 데이터셋(예: Financial PhraseBank, FiQA, FOMC 성명서, FinRED, LendingClub)을 사용해 보고, 컴플라이언스, 트레이딩 등 현업에서 마주치는 데이터를 그대로 반영합니다.
  • 제로샷 평가 – 모델은 보지 못한 과제에 대해 평가되어 추가 파인튜닝 없이 새로운 금융 상황에 일반화할 수 있는지를 보여줍니다.
  • 다중 메트릭 점수 – 과제별 적합한 다양한 메트릭으로 성능을 측정합니다: Accuracy, F1‑Score, Entity F1, Exact‑Match Accuracy, RMSE, ROUGE, BERTScore, BARTScore, Matthews Correlation Coefficient (MCC), 그리고 트레이딩 시뮬레이션에서는 Sharpe Ratio. 이러한 다차원 시각은 사용자가 강점과 약점을 정확히 파악하도록 돕습니다.

지원 과제 및 메트릭 (선택 예시)

카테고리 예시 과제 설명 주요 메트릭
Information Extraction NER 기업·상품 등 엔터티를 보고서에서 식별 Entity F1
FinRED 소유·인수 관계 추출 F1, Entity F1
Textual Analysis FPB / FiQA‑SA / TSA 뉴스·보고서·트윗 감성 분류 Accuracy, F1, RMSE
FOMC 연방공개시장위원회 성명서를 매파·비둘기형으로 분류 Accuracy, F1
Question Answering FinQA 재무제표 데이터에 대한 수치형 QA Exact‑Match Accuracy
ConvFinQA 다회전 금융 대화 Exact‑Match Accuracy
Text Generation EDTSUM / ECTSUM 장문 보고서 추출 요약 ROUGE, BERTScore, BARTScore
Forecasting BigData22 뉴스 기반 주가 방향 예측 Accuracy, MCC
Risk Management LendingClub / ccf / ccfraud 신용 위험·사기 탐지 F1, MCC
Decision‑Making FinTrade 시뮬레이션 트레이딩; 수익성 평가 Sharpe Ratio

리더보드 사용 방법

  1. 과제 선택 – “Select columns to show” 패널에서 40개 과제 중 원하는 부분을 선택합니다. 과제는 일곱 카테고리별로 그룹화돼 빠르게 필터링할 수 있습니다.
  2. 모델 필터링 – 오른쪽 필터를 이용해 모델 유형(프리트레인, 인스트럭션‑튜닝, RL‑튜닝), 정밀도(float16, bfloat16, float32), 규모(≈1.5 B ~ >70 B 파라미터) 등으로 결과를 좁힙니다.
  3. 결과 보기 – 과제 테이블에 선택한 과제별 모델 점수가 표시되고, 카테고리별 평균(Average IE, Average TA 등)으로 집계됩니다.
  4. 모델 제출 – “Submit here” 탭을 클릭하고 모델 레포 이름, 커밋 해시, 유형, 정밀도, 가중치 포맷을 입력합니다. 플랫폼이 전체 제로샷 스위트를 실행하고 실시간으로 테이블을 업데이트합니다.

현재 최고 모델 및 놀라운 발견

  • 최고 성능 모델 – GPT‑4와 Llama 3.1이 대부분 카테고리에서 일관되게 최고 점수를 기록하며, 특히 감성 중심 과제에서 두드러집니다.
  • 규모‑성능 탈동조 – 예측(FO) 카테고리에서는 Llama‑3.1‑7Binternlm‑7B가 훨씬 큰 Llama‑3.1‑70B보다 Accuracy와 MCC에서 앞섭니다. 이는 모델 규모가 시계열·시장 예측과 같이 시간에 민감한 과제의 성공을 좌우하는 유일한 요인이 아님을 시사합니다.
  • 시사점 – 실무자는 규모가 큰 범용 LLM이 모든 금융 사용 사례를 장악한다는 가정보다 과제‑특화 벤치마크를 우선시해야 합니다.

감사의 글

리더보드는 The Linux Foundation의 지원을 일부 받으며, 연구자·엔지니어 커뮤니티의 기여로 구축되었습니다. 프로젝트는 지속적인 참여를 환영합니다: 새로운 모델, 데이터셋, 평가 과제를 제출해 벤치마크를 최신·포괄적으로 유지해 주세요.


실시간 리더보드 보기 및 모델 제출은 Open FinLLM Leaderboard(https://huggingface.co/spaces/TheFinAI/Open-Financial-LLM-Leaderboard)에서 확인할 수 있습니다.

Sources