Argilla 2.4 릴리즈 노트 / 새로운 내용
Argilla 2.4는 Hugging Face Hub에서 데이터셋을 Argilla UI로 직접 가져올 수 있게 하여 코드를 작성하지 않고도 AI 데이터셋을 준비할 수 있게 합니다. 이 업데이트는 파인튜닝 및 평가를 위한 인간 피드백 수집을 간소화하여, Python에 익숙하지 않은 도메인 전문가도 데이터셋을 손쉽게 만들 수 있도록 민주화합니다.
Hugging Face Hub에서 노코드 데이터셋 준비
Argilla 2.4는 현재 230,000개 이상의 데이터셋을 보유하고 있는 Hugging Face Hub에서 공개된 모든 데이터셋을 가져와 AI 프로젝트의 기반으로 사용할 수 있게 합니다. Argilla UI를 사용하면 개발자와 도메인 전문가가 Python SDK를 사용하지 않고도 질문을 정의하고 인간 피드백을 수집할 수 있습니다.
이 기능은 여러 주요 사용 사례를 지원하도록 설계되었습니다:
- 커뮤니티 기여: 사용자는 공개 Argilla Space에 오픈 데이터셋을 가져와 URL을 공유함으로써 더 넓은 커뮤니티로부터 피드백을 수집할 수 있습니다.
- 새 데이터셋 생성: 사용자는 CSV 파일을 Hub에 업로드하고 이를 Argilla Space에 가져와 처음부터 라벨링을 시작할 수 있습니다.
- 데이터셋 큐레이션: 기존 Hub 데이터셋을 Argilla Space에 가져와 모델 파인튜닝 또는 평가를 위한 큐레이션에 활용할 수 있습니다.
- 데이터셋 개선: 사용자는 기존 Hub 데이터셋을 가져와 피드백을 제공하고 커뮤니티를 위해 개선할 수 있습니다.
기술 워크플로우 및 구현
이 기능을 사용하려면 먼저 Argilla를 배포해야 하며, 권장 방법은 Hugging Face Spaces에 배포하는 것입니다. 기본 배포에는 Hugging Face OAuth가 포함되어 있어, Space가 공개된 경우 Hub 사용자가 주석을 기여할 수 있습니다.
가져오기 과정은 다음 단계로 진행됩니다:
- 데이터셋 선택: 사용자는 로그인 후 홈 페이지의 "Import dataset from Hugging Face" 버튼을 사용하여 저장소 ID를 입력하거나 예시 데이터셋을 선택합니다.
- 구성: Argilla는 데이터셋의 특성을 기반으로 초기 구성을 자동으로 제안합니다. 이후 사용자는 라벨, 평점, 순위, 텍스트와 같은 질문을 추가하거나 텍스트, 채팅, 이미지와 같은 불필요한 필드를 제거할 수 있습니다.
- 데이터셋 생성: 구성이 최종 확정되고 실시간으로 변경 사항이 반영되면, 사용자는 "Create dataset"을 클릭하여 가져오기를 완료합니다.
이 기능의 첫 번째 버전에서는 Hub 데이터셋이 공개되어 있어야 합니다. 비공개 데이터셋 지원은 현재 향후 개발을 위한 요청 기능입니다.
Hugging Face 생태계와의 통합
노코드 UI가 가져오기 과정을 단순화하지만, 고급 커스터마이징이 필요한 사용자를 위해 Argilla Python SDK는 여전히 사용할 수 있습니다. Argilla는 Hugging Face Hub와 통합된 오픈소스 데이터 중심 도구로, AI 개발자와 도메인 전문가가 고품질 데이터셋을 구축하기 위해 협업할 수 있도록 설계되었습니다.