allenai/dolma
Data and tools for generating and inspecting OLMo pre-training data.
해결하는 문제
Dolma는 기계 학습 모델의 사전 훈련을 위한 대규모 데이터셋을 큐레이션하는 고성능 방법을 제공합니다. 웹 콘텐츠, 학술 논문, 코드 등 다양한 출처에서 수십억 개의 문서를 처리하고 정제하여 고품질의 학습 코퍼스를 만드는 과제를 해결합니다.
작동 방식
이 프로젝트는 두 가지 구성 요소로 이루어져 있습니다: 3조 토큰 규모의 대규모 오픈 데이터셋과 툴킷입니다. 툴킷은 내장된 병렬 처리 기능을 사용하여 단일 머신, 클러스터, 또는 클라우드 환경에서 문서를 동시에 처리할 수 있습니다. 인기 있는 큐레이션 방법(Gopher 및 C4 등)을 기반으로 한 사전 구축된 태거를 포함하며, 빠른 문서 중복 제거를 위해 Rust 기반의 Bloom 필터를 사용합니다.
대상 사용자
대규모 언어 모델을 개발하는 연구자 및 개발자로, 사전 훈련을 위한 막대한 양의 원시 데이터를 큐레이션, 정제, 중복 제거할 도구가 필요한 분들입니다.
주요 특징
- 대규모 오픈 데이터셋: 웹, 학술, 코드 데이터를 포함한 3조 토큰 규모의 다양한 데이터에 접근 가능.
- 고성능: 수십억 개의 문서를 동시에 처리할 수 있음.
- 클라우드 네이티브: AWS S3 호환 스토리지 지원 및 다양한 컴퓨팅 환경에서 작동.
- 즉시 사용 가능한 태거: 즉시 사용 가능한 표준 큐레이션 태거 포함.
- 빠른 중복 제거: Rust를 사용하여 중복 문서를 고속으로 제거.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트