파운데이션 모델이 인간처럼 데이터를 라벨링할 수 있을까? Hugging Face 분석
허깅페이스 연구자들은 파운데이션 모델, 구체적으로 GPT-4가 데이터를 안정적으로 라벨링하고 인간 판단의 대안으로 모델 선호도를 평가할 수 있는지 조사했다. 연구 결과는 GPT-4가 일부 인간 순위를 반영할 수 있지만, 상당한 위치 편향과 간결함보다 장황함을 선호하는 경향이 있어 인간 주석가의 완벽한 대체물이 되지 못함을 보여준다.
LLM 선호도 평가 방법론
허깅페이스는 Open LLM 리더보드를 확장하여 인간 라벨(Scale AI를 통해)과 GPT-4 평가를 비교하는 통제된 연구를 포함시켰다. 연구자들은 생성, 브레인스토밍, 질문 answering, 요약, 상식, 코딩 등의 카테고리에 걸쳐 327개의 고품질 인간 작성 프롬프트로 구성된 홀드아웃 세트를 사용했다.
네 개의 오픈소스 모델이 평가되었다: Vicuna-13B, Koala-13B, OpenAssistant-12B, 그리고 Dolly-12B. 평가자(인간과 GPT-4 모두)는 두 모델의 완성물 간의 선호도를 나타내기 위해 1부터 8까지의 리커트 척도를 사용했는데, 1은 첫 번째 모델에 대한 강한 선호를, 8은 두 번째 모델에 대한 강한 선호를 나타낸다.
인간 vs. GPT-4 Elo 순위
인간과 GPT-4 평가자는 모델의 상대적 순위를 비슷하게 만들었지만, 차이는 달랐다. 두 결과 세트 모두에서 Vicuna-13B가 일관되게 가장 높은 순위를 차지했으며, 그 뒤를 Koala-13B, OpenAssistant-12B, Dolly-12B가 이었다.
인간 Elo 결과 (중위수)
| 모델 | Elo 순위 (무승부 없음) | Elo 순위 (무승부 포함) |
|---|---|---|
| Vicuna-13B | 1140 | 1130 |
| Koala-13B | 1073 | 1061 |
| Oasst-12B | 986 | 988 |
| Dolly-12B | 802 | 820 |
GPT-4 Elo 결과 (중위수)
| 모델 | Elo 순위 (무승부 없음) | Elo 순위 (무승부 포함) |
|---|---|---|
| Vicuna-13B | 1134 | 1114 |
| Koala-13B | 1082 | 1082 |
| Oasst-12B | 972 | 973 |
| Dolly-12B | 812 | 831 |
LLM 기반 평가에서의 중요한 편향
이 연구는 GPT-4 평가자로서의 신뢰도에 영향을 미치는 몇 가지 체계적 편향을 확인했다:
위치 편향
GPT-4는 강한 위치 편향을 보여, 페어와이즈 비교에서 첫 번째 응답을 자주 선호한다(1-8 척도에서 "1"으로 평가). 이는 내용의 실제 품질과 무관하다.
장황함 및 스타일 편향
GPT-4는 간결하고 정확한 응답보다 더 길고 상세한 응답을 선호하는 경향이 있다. 이는 GPT-4가 장황한 모델 응답을 간결하고 정확한 인간 응답보다 "훨씬 더 나은" 것으로 평가한 예시에서 드러난다. 이는 다른 대형 언어 모델의 출력(예: Vicuna)을 기반으로 훈련된 모델에 "스타일 혜택"이 있음을 시사하는데, 연구자들은これを "의도하지 않은 도핑"이라고 설명한다.
인간 시연 역설
인간이 작성한 시연이 평가에 포함되었을 때, GPT-4는 이를 여러 오픈소스 모델(예: Vicuna와 Koala)보다 낮은 순위로 매겼으며, 이는 모델이 인간 스타일의 간결함보다 LLM 스타일의 장황함을 선호한다는 점을 더욱 강조한다.
상관관계 및 작업 성능
GPT-4와 인간 라벨 간의 상관관계는 작업 유형에 따라 크게 다르다. GPT-4는 낮은 엔트로피의 사실적 또는 기술적 작업보다 높은 엔트로피의 창의적 작업에서 인간과 더 잘 일치한다.
| 카테고리 | 상관관계: GPT-4 → 인간 라벨 |
|---|---|
| 브레인스토밍 | 0.60 |
| 창의적 생성 | 0.55 |
| 상식 추론 | 0.46 |
| 질문 응답 | 0.44 |
| 요약 | 0.40 |
| 자연어를 코드로 | 0.33 |
LLM 평가를 위한 핵심 시사점
- 위치 편향은 지속적: GPT-4에게 "de-bias"를 요청하면 종종 단순히 편향을 반대 방향으로 뒤집을 뿐 제거하지는 않는다.
- 장황함 $ eq$ 품질: GPT-4는 토큰 수에 보상을 주어, 유용하지 않지만 장황한 모델이 간결하고 정확한 모델보다 더 높은 순위를 받는 오해를 일으킬 수 있는 순위를 초래할 수 있다.
- 작업 의존적 신뢰도: LLM 기반 평가는 브레인스토밍과 창의적 생성에서 가장 신뢰도가 높고, 코딩 작업에서는 가장 신뢰도가 낮다.
- 포맷팅 제한: 연구자들은 ChatGPT와 같은 모델이 리커트 척도의 올바른 형식으로 답변을 반환하는 데 자주 어려움을 겪는다고 지적했는데, 이는 포맷팅 통제가 유용한 평가 도구가 되기 위한 전제 조건임을 나타낸다.