huggingface/tokenizers
💥 Fast State-of-the-Art Tokenizers optimized for Research and Production
What it solves
Tokenization은 머신러닝 모델의 핵심적인 전처리 단계입니다. 이 라이브러리는 가장 널리 사용되는 토큰화 알고리즘의 고성능 구현을체를 제공하여, 개발자가 원시 텍스트를 모델이 이해할 수 있는 토큰(tokens)으로 변환할 수 있게 합니다.
How it works
이 프로젝트는 최대 속도를 위해 Rust로 구현되었으며, Python, Node.js, Ruby의 바인딩을 제공합니다. BPE, WordPiece, 또는 Unigram과 같은 알고리즘을 사용하여 새로운 어휘집(vocabularies)을 학습시킬 수 있습니다. 정규화(normalization) 시의 정렬(alignment) 추적을 정,기능,プリトークン化(예: 공백으로 분할), 그리고 절단(truncation), 패딩(padding), 특수 토큰(special tokens) 추가와 같은 후처리 작업을 handles します。
Who it’s for
AI 모델을 위한 텍스트 토큰화를 위한 빠르고 다재능적이며 확장 가능한 방법이 필요한 연구자 및 프로덕션 엔지니어들을 위해 설계되었습니다.
Highlights
- 서버 CPU에서 1GB의 텍스트를 20초 미만으로 토큰화할 수 있는 자체 고속 Rust 구현.
- BPE, WordPiece, 및 Unigram을 포함한 여러 토큰화 모델을 지원.
- 패딩, 절단, 및 정규화를 위한 정렬 추적을 포함한 전체 전처리 프로세스.
- Python, Node.js, 및 Ruby 바인딩을 통한 다언어 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트