LoRA를 사용한 재난 트윗 분류에서 RoBERTa, Llama 2, Mistral 비교

이 연구는 Low-Rank Adaptation (LoRA)를 사용하여 재난 트윗 분류 작업에서 RoBERTa, Llama 2, Mistral 7B의 성능을 비교합니다. 결과는 더 작은 RoBERTa 모델이 정확도(F1 점수)와 효율성 측면에서 더 큰 7B 파라미터 모델보다 우수함을 보여주며, 이는 간단한 짧은 시퀀스 이진 분류 작업에서는巨大한 LLM이 필요하지 않을 수 있음을 시사합니다.

비교 성능 결과

세 가지 테스트된 모델 중에서 RoBERTa가 가장 높은 F1 점수와 가장 낮은 자원 소비를 달성했습니다. Llama 2는 Mistral 7B보다 나은 성능을 보였지만, 두 모델 모두 RoBERTa보다 상당히 느리고 메모리 집약적이었습니다.

모델 F1 점수 학습 시간 메모리 소비 훈련 가능한 파라미터
RoBERTa 0.8077 538초 GPU1: 9.1 Gb / GPU2: 8.3 Gb 0.64%
Llama 2 0.7638 2052초 GPU1: 35 Gb / GPU2: 33.9 Gb 0.12%
Mistral 7B 0.7364 2030초 GPU1: 29.6 Gb / GPU2: 29.5 Gb 0.024%

기술 구현 및 방법론

모델 아키텍처

서로 다른 세 가지 아키텍처가 모델의 크기와 유형이 분류 성능에 미치는 영향을 결정하기 위해 평가되었습니다.

  • RoBERTa (Large): 355M 파라미터를 가진 인코더 전용 트랜스포머 모델로, 기준선으로 사용되었습니다.
  • Llama 2 (7B): SwiGLU 활성화와 로터리 위치 임베딩을 특징으로 하는 자동 회귀 디코더 기반 모델입니다.
  • Mistral 7B (v0.1): 추론을 최적화하고 더 긴 시퀀스를 처리하기 위해 Sliding Window Attention과 Grouped-query Attention을 활용하는 디코더 기반 모델입니다.

LoRA 파인튜닝

Low-Rank Adaptation (LoRA)는 사전 학습된 가중치를 동결한 채 저랭크 업데이트 행렬을 학습하여 훈련 가능한 파라미터 수를 줄이는 데 사용되었습니다. 이 파라미터 효율적인 파인튜닝(PEFT) 접근 방식은 인코더와 디코더 아키텍처 모두에 적용되었습니다.

디코더 모델(Llama 2와 Mistral 7B)에 대해 LoRA는 q_projv_proj 모듈을 특별히 대상으로 했습니다. 그 결과 훈련 가능한 파라미터 비율은 매우 낮았습니다: Mistral 7B는 0.024%, Llama 2는 0.12%.

데이터셋 및 전처리

모델은 mehdiiraqui/twitter_disaster 데이터셋에서 훈련되었습니다. 공정한 비교를 위해 모든 모델에 최대 시퀀스 길이(MAX_LEN)를 512로 설정했으며, 이는 RoBERTa의 제한によるものです.

데이터셋이 긍정 및 부정 클래스의 불균형한 분포를 보였기 때문에, 맞춤형 WeightedCELossTrainer가 구현되었습니다. 이 트레이너는 compute_loss 메서드를 재정의하여 가중 교차 엔트로피 손실을 적용하며, 계산된 가중치(긍정: 1.1637, 부정: 0.8767)를 사용하여 다수 클래스에 대한 모델 편향을 방지합니다.

하드웨어 및 훈련 구성

훈련은 단일 노드에서 A6000 GPU 하나(48GB 메모리)를 사용하여 수행되었습니다.

Mistral 7B와 Llama 2의 크기로 인해 모델을 GPU 메모리에 맞추기 위해 반정밀도 훈련(fp16=True)이 필요했으며, 반면 RoBERTa는 반정밀도를 사용하지 않고 훈련되었습니다. 두 7B 모델은 메모리 사용을 추가로 관리하기 위해 그래디언트 체크포인팅을 활용했습니다.

주요 시사점

  • 모델 크기 vs. 작업 복잡도: 짧은 시퀀스를 포함하는 간단한 예측 작업에서는 RoBERTa와 같은 작은 기본 모델이 여전히 높은 경쟁력을 유지하며, 종종 더 큰 LLM보다 우수합니다.
  • 효율성 향상: RoBERTa는 7B 모델보다 약 3.8배 빠르게 훈련되며, znacz하게 적은 메모리를 사용합니다.
  • LoRA의 다용성: 이 연구는 LoRA가 인코더 전용 및 디코더 전용 트랜스포머 아키텍처 모두에서 시퀀스 분류에 효과적임을 확인합니다.

Sources