Hugging Face AI Sheets 출시
Hugging Face AI Sheets는 AI 모델을 사용하여 데이터셋을 구축, 풍부하게 만들고 변환하도록 설계된 오픈 소스 무코드 도구입니다. 사용자는 Inference Providers 또는 로컬 배포를 통해 Hugging Face Hub의 수천 개의 오픈 모델을 활용할 수 있으며, 여기에는 OpenAI의 gpt-oss와 같은 모델도 포함됩니다.
AI Sheets를 활용한 무코드 데이터셋 엔지니어링
AI Sheets는 스프레드시트와 유사한 사용자 인터페이스를 제공하여 사용자가 프롬프트를 작성함으로써 새로운 데이터 열을 만들 수 있게 합니다. 이 접근 방식은 빠른 실험을 가능하게 하며, 사용자는 작은 데이터셋으로 시작해 프롬프트를 반복 개선한 뒤 더 큰 데이터 생성 파이프라인으로 확장할 수 있습니다.
핵심 기능
사용자는 AI Sheets를 다양한 데이터 처리 및 생성 작업에 활용할 수 있습니다:
- 모델 비교 및 "Vibe Testing": 사용자는 프롬프트를 가져와 각 모델마다 하나씩 여러 열을 생성하여 출력 결과를 나란히 비교할 수 있습니다. 또 다른 LLM이 응답을 평가하는 "judge" 열을 추가하여 확장할 수도 있습니다.
- 프롬프트 최적화: 이 도구는 효율적인 프롬프트 미세 조정을 지원합니다. 셀을 편집하거나 "thumbs-up" 표시를 하면 사용자는 직접 피드백을 제공하게 되며, 도구는 이를 자동으로 몇 샷 예시로 활용해 이후 생성에 반영합니다.
- 데이터셋 변환 및 분류: AI Sheets를 사용해 텍스트를 정리(예: 구두점 제거)하거나, 콘텐츠를 분류하거나, 데이터셋에서 핵심 아이디어를 추출할 수 있습니다.
- 데이터 풍부화: "Search the web" 옵션을 활성화하면 모델을 사용해 특정 주소의 우편번호와 같은 누락된 정보를 찾을 수 있습니다.
- 합성 데이터 생성: 사용자는 원하는 구조를 자연어로 설명하거나 프롬프트를 연결해(예: 전문적인 바이오를 생성한 뒤 이를 활용해 현실적인 이메일 작성) 완전히 새로운 데이터셋을 처음부터 생성할 수 있습니다.
워크플로우 및 기술 구현
AI Sheets는 데이터에 대한 두 가지 주요 진입점을 지원합니다: 기존 파일(XLS, TSV, CSV 또는 Parquet)을 최대 1,000행까지 가져오거나, 자연어 설명을 사용해 처음부터 데이터셋을 생성합니다.
정제 및 확장
데이터가 로드되면 사용자는 여러 메커니즘을 통해 출력을 정제할 수 있습니다:
- 수동 피드백: 셀을 편집하거나 결과에 좋아요를 누르면 모델 재생성 시 또는 새 행을 추가할 때 몇 샷 예시로 활용됩니다.
- 열 설정: 사용자는 프롬프트를 수정하거나, 모델을 교체하거나, 인퍼런스 제공자를 변경해 성능을 최적화할 수 있습니다.
- 동적 확장: 사용자는 열의 마지막 셀을 아래로 끌어 추가 행을 즉시 생성할 수 있습니다.
Hub 통합 및 확장
AI Sheets에서 만든 데이터셋은 Hugging Face Hub로 내보낼 수 있습니다. 이 내보내기는 프롬프트와 몇 샷 예시를 보존하는 구성 파일(config.yml)을 생성합니다. 이 구성을 활용해 HF Jobs와 제공된 확장 스크립트를 사용하여 초기 스프레드시트 제한을 넘어 더 큰 규모의 데이터를 처리하며 데이터 생성을 확장할 수 있습니다.
배포 및 접근
AI Sheets는 Hugging Face Spaces를 통해 무료 도구로 접근하거나 GitHub 저장소를 통해 로컬에 배포할 수 있습니다. 로컬 사용자의 경우, Hugging Face는 월별 인퍼런스 사용량을 늘리기 위해 PRO 구독을 권장합니다.