Aya Expanse 출시: 다국어 LLM 성능 향상

Hugging Face와 Cohere For AI는 다국어와 단일언어 AI 간의 성능 격차를 해소하도록 설계된 8B 및 32B 파라미터 모델을 특징으로 하는 Aya Expanse 제품군을 출시했습니다. 이 모델들은 다국어 성능에 대한 새로운 최첨단을 제시하며, 32B 모델은 m-ArenaHard 데이터셋에서의 쌍별 비교에서 Llama 3.1 70B, Gemma 2 27B, 그리고 Mistral 8x22B보다 우수한 성능을 보였습니다.

성능 벤치마크

Aya Expanse 모델은 해당 크기 클래스의 다른 주요 오픈-웨이트 모델에 비해 우수한 성능을 보여줍니다:

  • Aya Expanse 32B: Llama 3.1 70B(크기가 두 배 이상 큰 모델)와 Gemma 2 27B, Mistral 8x22B보다 우수합니다.
  • Aya Expanse 8B: Gemma 2 9B, Llama 3.1 8B, 그리고 Ministral 8B보다 우수하며, 승률은 60.4%에서 70.6% 사이입니다.

평가는 Arena-Hard-Auto 데이터셋을 23개 언어로 번역한(m-ArenaHard) 데이터를 사용하여 수행되었습니다.

다국어 차익거래를 통한 모델 붕괴 방지

합성 데이터에 과도하게 의존함으로써 발생하는 모델 붕괴를 방지하기 위해 Cohere For AI는 "데이터 차익거래"를 구현했습니다. 이 기법은 단일 교사 모델에 의존하는 대신 교사 모델 풀에서 전략적으로 샘플링하며, 이는 모든 언어에서 뛰어난 단일 모델이 존재하지 않는 저자원 언어에 특히 중요합니다.

차익거래 과정:

  1. Model Pool: 특정 언어 그룹을 위해 모델 풀을 훈련합니다.
  2. Arbiter: 내부 보상 모델(RM)이 중재자 역할을 하여 주어진 프롬프트에 대해 풀 내 모든 모델의 생성물을 점수화합니다.
  3. Reward-Based Routing: 가장 높은 점수를 받은 완성이 최종 학습 데이터로 선택됩니다.

이 접근법은 이전 Aya 23 모델에 비해 SFT 단계에서 8B 모델이 Gemma 2 9B에 대해 승률이 9.1% 향상되었습니다.

다국어 선호도 최적화

다국어 환경에서 인간 선호도에 맞추는 것은 고품질 비영어 선호도 데이터셋이 부족하기 때문에 어려운 과제입니다. Aya Expanse는 하이브리드 오프라인 및 온라인 선호도 훈련 파이프라인을 활용합니다:

합성 선호도 데이터 생성

팀은 고성능 다국어 LLM의 동일 언어 내 완성과 영어에서 번역된(약한 모델이 생성한) 낮은 품질의 완성을 대비시켜 고품질 선호도 쌍을 생성했습니다. 이를 통해 모델이 번역 아티팩트와 열악한 다국어 완성으로부터 벗어나도록 유도합니다.

하이브리드 DPO 파이프라인

  • Offline Stage: 모델은 먼저 차익거래 단계에서 가장 높은 보상과 가장 낮은 보상 응답을 선별한 데이터로 훈련됩니다.
  • Online Iterative DPO: 모델은 온라인 DPO를 세 번 반복합니다. 각 반복에서 현재 모델로부터 여러 생성물을 샘플링하고, 보상 모델에 의해 순위가 매겨진 뒤 추가 학습에 사용됩니다.

8B 모델의 경우, 이 오프라인 및 온라인 선호도 훈련을 결합함으로써 Gemma 2 9B에 대한 승률이 추가로 7.1% 상승했습니다.

모델 병합을 통한 성능 극대화

데이터 혼합에 대한 하이퍼파라미터 튜닝의 계산 비용을 줄이기 위해 팀은 모델 병합을 사용했습니다. 이는 서로 다른 언어군에 대해 별도 모델을 훈련시켜 체크포인트 간 다양성을 극대화하고 교차 언어 전이를 활용하는 것을 의미합니다.

핵심 병합 전략:

  • Diversity via Language Families: 모델은 차별성을 보장하기 위해 서로 다른 언어 클러스터에서 훈련되며, 각 클러스터에 공유 언어(English, Spanish, French)를 포함시켜 견고함을 유지합니다.
  • Weighted Averaging: SLERP, TIES-merging, DARE-TIES를 테스트했지만, 가중 선형 평균이 가장 일관된 방법으로 밝혀졌습니다.
  • Scaling Effects: 모델 병합은 8B 규모에 비해 32B 규모에서 훨씬 큰 이득을 제공했으며, 이득이 최대 3배까지 증가했습니다.

사후 훈련 파이프라인 요약

최종 Aya Expanse 모델은 합성 데이터 품질을 위한 다국어 차익거래, 선호도 정렬을 위한 하이브리드 오프라인/온라인 DPO 프로세스, 그리고 다양한 언어군에서 다중 작업을 최적화하기 위한 전략적 모델 병합을 결합한 다단계 파이프라인의 결과물입니다.

SUMMARY: Hugging Face와 Cohere For AI가 8B와 32B 오픈-웨이트 모델군인 Aya Expanse를 출시했으며, 이는 다국어 성능에 대한 새로운 최첨단 벤치마크를 설정했습니다.

TITLE: Aya Expanse 출시: 다국어 LLM 성능 향상

Sources