snorkel-team/snorkel
A system for quickly generating training data with weak supervision
해결하는 문제
Snorkel은 머신러닝에서 수동 데이터 라벨링의 병목 현상을 해결합니다. 사람이 수천 개의 개별 예제를 수동으로 라벨링하는 대신, 사용자가 프로그래밍 방식으로 학습 데이터를 생성하고 관리할 수 있게 하여 고품질 데이터 세트를 구축하는 데 필요한 시간과 노력을 줄여줍니다.
작동 방식
사용자가 라벨링 함수를 작성하여 데이터에 프로그래밍 방식으로 라벨을 할당할 수 있는 "약지도 학습" 프레임워크를 제공합니다. 이 접근 방식은 데이터 생성 프로세스에 수학적 및 시스템적 구조를 도입하여 반복적인 개발을 가능하게 하며, 모든 인스턴스를 수동으로 라벨링하지 않고도 학습 파이프라인에 도메인 전문 지식을 주입할 수 있게 합니다.
대상 사용자
머신러닝 프로젝트를 위해 대량의 라벨링된 학습 데이터를 효율적으로 생성해야 하는 머신러닝 엔지니어, 연구원 및 도메인 전문가를 위해 설계되었습니다.
주요 특징
- 학습 데이터의 프로그래밍 방식 라벨링
- 약지도 학습 모델링을 위한 프레임워크
- 데이터 증강 및 멀티태스크 학습 지원
- 의학 및 산업을 포함한 다양한 도메인과의 통합
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트