Hugging Face CFM 사례 연구: LLM 인사이트를 활용한 소형 모델 파인튜닝
Capital Fund Management (CFM)는 대형 언어 모델(LLM)을 사용하여 더 작고 효율적인 모델의 학습 데이터를 라벨링함으로써 금융 데이터의 Named Entity Recognition(NER)을 성공적으로 최적화했습니다. 이 접근 방식은 정확도를 최대 6.4% 향상시키고, 대형 LLM만을 추론에 의존하는 것보다 운영 비용을 최대 80배 줄였습니다.
LLM 지원 라벨링 워크플로
CFM은 LLM 자동화와 인간 검증을 결합한 파이프라인을 사용하여 파인튜닝을 위한 고품질 데이터셋을 만들었습니다. 이 과정은 다음과 같은 단계로 구성됩니다:
합성 라벨 생성
CFM은 Hugging Face Inference Endpoints를 사용하여 Llama 3.1-70b-Instruct를 배포했습니다. 구조화되고 정확한 출력을 보장하기 위해, 팀은 모델을 금융 전문가로 정의하는 특정 시스템 프롬프트를 사용하고, Pydantic 스키마를 구현하여 모델이 원본 추출된 회사 이름과 그 정규화된 버전을 모두 포함하는 JSON을 반환하도록 강제했습니다.
Financial News and Stock Price Integration Dataset (FNSPID)에서 900,000개의 샘플을 처리하는 데 약 8시간이 소요되었고 비용은 약 $70였습니다.
인간 참여형 루프 정제
ground truth의 신뢰성을 보장하기 위해 CFM은 오픈소스 데이터 주석 플랫폼인 Argilla를 사용했습니다. 팀은 퍼지 매칭을 통해 생성된 회사 클러스터를 기반으로 2,714개의 헤드라인을 샘플링했습니다.
미리 계산된 Llama 라벨을 시작점으로 사용함으로써, 인간 주석가는 샘플당 소요 시간을 30초에서 5-10초로 줄였습니다. 2,714개 샘플에 대한 전체 주석 작업은 약 8시간에 완료되었습니다.
제로샷 성능 비교
파인튜닝 전에 CFM은 큐레이트된 데이터셋에서 성능 기준을 설정하기 위해 여러 모델을 제로샷 설정에서 평가했습니다:
| 모델 | F1-점수 (제로샷) |
|---|---|
| Llama 3.1-70b | 95% |
| Llama 3.1-8b | 88% |
| GLiNER | 87% |
| SpanMarker | 47% |
Llama 3.1-70b는最高 정확도를 제공했지만, 그 계산 요구 사항은 컴팩트 모델보다 훨씬 높습니다.
컴팩트 모델에 대한 파인튜닝의 영향
LLM 지원 인간 검증 데이터셋에서 소형 모델을 파인튜닝함으로써 비용을 크게 줄이면서 최대 규모의 LLM과 맞먹는 성능 향상을 달성했습니다.
성능 향상
파인튜닝은 소형 모델의 성능을 다음과 같이 변화시켰습니다:
- GLiNER-medium-news의 F1-점수가 87.0%에서 **93.4%**로 향상되었습니다.
- SpanMarker의 F1-점수가 47.0%에서 **90.1%**로 향상되었습니다.
비용과 효율성
파인튜닝된 소형 모델과 대형 LLM 사이의 비용 차이는 상당합니다:
- Llama 3.1-70b는 추론에 최소 시간당 $8이 듭니다.
- **Compact models (GPU)**는 시간당 약 $0.50 듭니다 (16배 더 저렴).
- **Compact models (CPU)**는 시간당 약 $0.10 듭니다 (80배 더 저렴).
약한 감독 vs. 인간 주석 데이터
CFM은 인간 주석 데이터에서 GLiNER를 파인튜닝한 결과와 Llama 3.1-70b가 생성한 합성 데이터(약한 감독)에서의 결과를 비교했습니다.
- 정확도: 데이터 크기가 증가함에 따라 인간 주석 데이터로 훈련된 모델은 일관되게 더 높은 F1-점수를 달성했습니다.
- Trade-off: 1,000개의 샘플에 대해 수동 주석은 3시간이 걸렸고 F1 점수는 0.915였으며, Llama 3.1-70b 추론은 2분이 걸렸고 F1 점수는 0.895였습니다.
이 연구는 LLM 지원 라벨링이 확장에 매우 효율적이지만, 최대 정확도를 달성하기 위해서는 인간 검증이 여전히 중요하다는 결론을 내립니다.}