Hugging Face 데이터는 함께할 때 더 좋다 이니셔티브

개요

Hugging Face와 Argilla는 오픈소스 ML 커뮤니티의 지원을 받아 Data Is Better Together (DIBT) 이니셔티브를 설립하여 영향력 있는 데이터셋을 공동으로 만들 수 있도록 했습니다. 이 프로젝트는 커뮤니티 주도형 데이터 큐레이션을 촉진하고 개발자와 도메인 전문가가 고품질 데이터셋을 독립적으로 구축하는 데 필요한 도구를 제공함으로써 영어 중심 데이터에서 벗어나는 것을 목표로 합니다.

커뮤니티 주도 데이터셋 성과

DIBT 이니셔티브는 프롬프트 품질 향상과 다국어 평가를 개선하기 위해 두 가지 주요 커뮤니티 프로젝트에 집중했습니다.

프롬프트 순위 프로젝트

이 이니셔티브는 합성 및 인간이 생성한 항목을 포함한 10,000개의 프롬프트 데이터셋을 성공적으로 만들었으며, 품질에 따라 순위가 매겨졌습니다. 이 작업에는 385명 이상의 참여자가 참여했으며 DIBT/10k_prompts_ranked 데이터셋이 공개되었습니다. 이 데이터셋은 프롬프트 순위 작업 및 합성 데이터 생성에 설계되었으며 이미 SPIN을 포함한 새로운 모델 개발에 사용되었습니다.

다국어 프롬프트 평가 프로젝트 (MPEP)

오픈 대형 언어 모델(LLM)을 위한 언어별 벤치마크 부족을 해결하기 위해 MPEP가 다국어 리더보드를 개발하기 위해 만들어졌습니다. 이 프로젝트는 DIBT/10k_prompts_ranked 데이터셋에서 500개의 고품질 프롬프트를 선택하여 다양한 언어로 번역했습니다. 이 노력은 다음과 같은 진행 상황을 보이고 있습니다:

  • 18개 이상의 언어 리더가 번역 공간을 구축했습니다.
  • 네덜란드어, 러시아어, 스페인어 등 여러 언어에 대한 번역이 완료되었으며 추가 언어에 대한 작업이 진행 중입니다.
  • Discord에서 전용 데이터셋 구축 커뮤니티가 형성되었습니다.

데이터셋 생성 가이드 및 도구

“cookbook” 활동의 일환으로 DIBT는 커뮤니티가 독립적으로 특화된 데이터셋을 구축할 수 있도록 가이드와 도구를 제공합니다. 이 리소스는 세 가지 핵심 영역에 초점을 맞춥니다:

  • Domain-Specific Datasets: 엔지니어와 도메인 전문가가 협업하여 특정 분야에 맞춘 데이터셋 생성을 시작할 수 있도록 돕는 리소스.
  • DPO/ORPO Datasets: 다양한 언어, 도메인 및 작업에 걸쳐 Direct Preference Optimization (DPO) 스타일 데이터셋을 구축하기 위한 안내.
  • KTO Datasets: 커뮤니티가 Kahneman-Tversky Optimization (KTO) 데이터셋을 만들 수 있도록 돕는 도구와 지침.

주요 인사이트 및 교훈

DIBT 이니셔티브를 통해 Hugging Face와 Argilla는 오픈소스 데이터 협업에 관한 몇 가지 중요한 발견을 확인했습니다:

  • Community Demand: 커뮤니티 내에서 집단 데이터셋 구축에 참여하려는 큰 기대와 강한 의지가 존재합니다.
  • Data Inequality: 기존의 불평등이 지속되어 특정 언어, 도메인 및 작업이 오픈소스 벤치마크에서 충분히 대표되지 않으며, 포괄적인 평가를 보장하기 위해 보다 포용적인 접근이 필요합니다.
  • Tooling Availability: 데이터셋 구축을 위한 효과적인 커뮤니티 협업에 필요한 도구는 이미 존재하며, 커뮤니티 규모에 맞게 활용될 수 있습니다.

기여 방법

DIBT 이니셔티브에 대한 기여는 지속되고 있습니다. 사용자는 특정 cookbook 프로젝트에 대한 README 지침을 따라 데이터셋과 결과를 공유하거나 새로운 가이드와 도구를 기여함으로써 참여할 수 있습니다. 이러한 노력의 조정은 Hugging Face Discord 서버의 #data-is-better-together 채널에서 이루어집니다.

Sources