Open FinLLM 리더보드 출시 – 금융 언어 모델을 위한 포괄적인 제로샷 벤치마크
TL;DR
Hugging Face가 출시한 Open FinLLM Leaderboard(OFLL)는 40개의 과제와 7개의 카테고리에 걸친 금융 전용 제로샷 평가 스위트를 제공하여 실제 금융 활용 사례에 대한 모델 준비도를 투명하게 벤치마킹할 수 있게 합니다.
Open FinLLM Leaderboard가 무엇인가
OFLL은 금융 전문가에게 중요한 과제들을 평가하는 공개 웹 기반 플랫폼입니다. 일반 NLP 리더보드가 남긴 공백을 메우며 정보 추출, 감성 분석, 신용 위험 점수화, 주가 움직임 예측 및 기타 금융 특화 기능에 초점을 맞춥니다. 모델은 과제별 파인튜닝 없이 테스트되므로 결과는 진정한 제로샷 일반화를 반영합니다.
주요 특징
- 과제 범위 – 40개의 선별된 과제는 정보 추출(IE), 텍스트 분석(TA), 질문 응답(QA), 텍스트 생성(TG), 위험 관리(RM), 예측(FO), 의사결정(DM) 등 일곱 카테고리로 구성됩니다. 과제에는 NER, 인과 분류, 금융 QA(FinQA, TATQA), 주가 움직임 예측(BigData22, ACL18, CIKM18), 다국가 신용 위험 점수화, ESG 이슈 탐지, 그리고 트레이딩 시뮬레이션 벤치마크(FinTrade)가 포함됩니다.
- 실제 데이터셋 – 각 과제는 공개된 금융 데이터셋(예: Financial PhraseBank, FiQA, FOMC 성명서, FinRED, LendingClub)을 사용해 보고, 컴플라이언스, 트레이딩 등 현업에서 마주치는 데이터를 그대로 반영합니다.
- 제로샷 평가 – 모델은 보지 못한 과제에 대해 평가되어 추가 파인튜닝 없이 새로운 금융 상황에 일반화할 수 있는지를 보여줍니다.
- 다중 메트릭 점수 – 과제별 적합한 다양한 메트릭으로 성능을 측정합니다: Accuracy, F1‑Score, Entity F1, Exact‑Match Accuracy, RMSE, ROUGE, BERTScore, BARTScore, Matthews Correlation Coefficient (MCC), 그리고 트레이딩 시뮬레이션에서는 Sharpe Ratio. 이러한 다차원 시각은 사용자가 강점과 약점을 정확히 파악하도록 돕습니다.
지원 과제 및 메트릭 (선택 예시)
| 카테고리 | 예시 과제 | 설명 | 주요 메트릭 |
|---|---|---|---|
| Information Extraction | NER | 기업·상품 등 엔터티를 보고서에서 식별 | Entity F1 |
| FinRED | 소유·인수 관계 추출 | F1, Entity F1 | |
| Textual Analysis | FPB / FiQA‑SA / TSA | 뉴스·보고서·트윗 감성 분류 | Accuracy, F1, RMSE |
| FOMC | 연방공개시장위원회 성명서를 매파·비둘기형으로 분류 | Accuracy, F1 | |
| Question Answering | FinQA | 재무제표 데이터에 대한 수치형 QA | Exact‑Match Accuracy |
| ConvFinQA | 다회전 금융 대화 | Exact‑Match Accuracy | |
| Text Generation | EDTSUM / ECTSUM | 장문 보고서 추출 요약 | ROUGE, BERTScore, BARTScore |
| Forecasting | BigData22 | 뉴스 기반 주가 방향 예측 | Accuracy, MCC |
| Risk Management | LendingClub / ccf / ccfraud | 신용 위험·사기 탐지 | F1, MCC |
| Decision‑Making | FinTrade | 시뮬레이션 트레이딩; 수익성 평가 | Sharpe Ratio |
리더보드 사용 방법
- 과제 선택 – “Select columns to show” 패널에서 40개 과제 중 원하는 부분을 선택합니다. 과제는 일곱 카테고리별로 그룹화돼 빠르게 필터링할 수 있습니다.
- 모델 필터링 – 오른쪽 필터를 이용해 모델 유형(프리트레인, 인스트럭션‑튜닝, RL‑튜닝), 정밀도(float16, bfloat16, float32), 규모(≈1.5 B ~ >70 B 파라미터) 등으로 결과를 좁힙니다.
- 결과 보기 – 과제 테이블에 선택한 과제별 모델 점수가 표시되고, 카테고리별 평균(Average IE, Average TA 등)으로 집계됩니다.
- 모델 제출 – “Submit here” 탭을 클릭하고 모델 레포 이름, 커밋 해시, 유형, 정밀도, 가중치 포맷을 입력합니다. 플랫폼이 전체 제로샷 스위트를 실행하고 실시간으로 테이블을 업데이트합니다.
현재 최고 모델 및 놀라운 발견
- 최고 성능 모델 – GPT‑4와 Llama 3.1이 대부분 카테고리에서 일관되게 최고 점수를 기록하며, 특히 감성 중심 과제에서 두드러집니다.
- 규모‑성능 탈동조 – 예측(FO) 카테고리에서는 Llama‑3.1‑7B와 internlm‑7B가 훨씬 큰 Llama‑3.1‑70B보다 Accuracy와 MCC에서 앞섭니다. 이는 모델 규모가 시계열·시장 예측과 같이 시간에 민감한 과제의 성공을 좌우하는 유일한 요인이 아님을 시사합니다.
- 시사점 – 실무자는 규모가 큰 범용 LLM이 모든 금융 사용 사례를 장악한다는 가정보다 과제‑특화 벤치마크를 우선시해야 합니다.
감사의 글
리더보드는 The Linux Foundation의 지원을 일부 받으며, 연구자·엔지니어 커뮤니티의 기여로 구축되었습니다. 프로젝트는 지속적인 참여를 환영합니다: 새로운 모델, 데이터셋, 평가 과제를 제출해 벤치마크를 최신·포괄적으로 유지해 주세요.
실시간 리더보드 보기 및 모델 제출은 Open FinLLM Leaderboard(https://huggingface.co/spaces/TheFinAI/Open-Financial-LLM-Leaderboard)에서 확인할 수 있습니다.