Hugging Face와 Argilla가 공동 커뮤니티 데이터셋 구축을 가능하게 하다

Hugging Face와 Argilla는 오픈소스 커뮤니티가 고품질 데이터셋을 공동으로 구축할 수 있도록 하는 이니셔티브를 시작했으며, 비기술적 기여자들의 진입 장벽을 낮추고자 합니다. 이 노력은 많은 언어, 도메인 및 특정 작업에 대한 고품질 학습, 평가 및 벤치마킹 데이터 부족 문제를 해결하는 것을 목표로 합니다.

Argilla와 Hugging Face Spaces를 통한 공동 데이터셋 구축

공동 데이터셋 구축을 통해 머신러닝이나 프로그래밍 기술이 없는 개인도 오픈소스 ML 개발에 직접 기여할 수 있습니다. 간소화된 기술 워크플로를 활용함으로써 커뮤니티는 다음과 같은 다양한 데이터 유형에 협업할 수 있습니다:

  • 언어별 채팅 데이터셋: 대표성이 낮은 언어를 위한 데이터 생성.
  • 도메인별 벤치마크: 특수 분야를 위한 평가 세트 개발.
  • 선호도 데이터셋: 다양한 참여자로부터 순위 수집.
  • 작업별 데이터셋: 특정 머신러닝 작업에 맞춘 데이터 구축.

기술 구현 및 워크플로

공동 데이터 주석의 주요 기술적 장벽은 효율적인 주석 작업을 설정하는 어려움이었습니다. 이는 LLM 및 작업별 데이터셋을 만들기 위한 오픈소스 도구인 Argilla와 ML 데모 및 애플리케이션을 호스팅하는 플랫폼인 Hugging Face Spaces를 결합함으로써 해결됩니다.

Argilla는 이제 Spaces에 호스팅된 인스턴스에 대해 Hugging Face 계정 인증을 지원합니다. 이 통합을 통해 사용자는 몇 초 만에 주석 작업에 기여를 시작할 수 있어 커뮤니티 참여 장벽이 크게 낮아집니다.

개념 증명: 10k_prompts_ranked 데이터셋

이 워크플로를 테스트하기 위해 Hugging Face와 Argilla는 "Data is Better Together"라는 실험을 수행했으며, 이는 프롬프트 순위에 대한 선호도 데이터셋 구축에 초점을 맞추었습니다. 결과는 커뮤니티 주도 접근 방식의 효율성을 보여주었습니다:

  • 기여자 수: 350명의 커뮤니티 기여자가 데이터 라벨링에 참여했습니다.
  • 데이터 양: 며칠 만에 11,000개 이상의 프롬프트 평가가 수집되었습니다.
  • 결과: 사용자 평가가 포함된 10,000개의 프롬프트를 담은 10k_prompts_ranked 데이터셋이 공개되었습니다.

커뮤니티 코호트 지원

Hugging Face와 Argilla는 이 모델을 확장하기 위해 초기 커뮤니티 데이터셋 구축자 코호트를 모집하고 있습니다. 이 코호트 참가자를 위한 지원 내용은 다음과 같습니다:

  • 인프라: Hugging Face 인증이 포함된 Argilla Space 생성 지원, Hugging Face가 제공하는 무료 영구 스토리지 및 향상된 CPU 공간 포함.
  • 가시성: Argilla와 Hugging Face가 공동으로 커뮤니케이션 및 홍보 활동을 확대.
  • 협업: 전용 코호트 커뮤니티 채널 접근.

프로젝트 범위 및 제한 사항

이 이니셔티브는 주로 텍스트 기반 데이터셋에 초점을 맞추며, 특히 현재 오픈소스 생태계에서 대표성이 낮은 언어, 도메인 및 작업을 대상으로 합니다. 프로그램은 멀티모달 데이터셋 아이디어에도 열려 있지만, 첫 번째 코호트에서는 지원이 제한될 수 있습니다. 주석 작업은 공개적으로 완전히 열거나 특정 Hugging Face Hub 조직의 구성원에게만 제한하도록 설정할 수 있습니다.

Sources