huggingface/tokenizers

💥 Fast State-of-the-Art Tokenizers optimized for Research and Production

What it solves

Tokenization은 머신러닝 모델의 핵심적인 전처리 단계입니다. 이 라이브러리는 가장 널리 사용되는 토큰화 알고리즘의 고성능 구현을체를 제공하여, 개발자가 원시 텍스트를 모델이 이해할 수 있는 토큰(tokens)으로 변환할 수 있게 합니다.

How it works

이 프로젝트는 최대 속도를 위해 Rust로 구현되었으며, Python, Node.js, Ruby의 바인딩을 제공합니다. BPE, WordPiece, 또는 Unigram과 같은 알고리즘을 사용하여 새로운 어휘집(vocabularies)을 학습시킬 수 있습니다. 정규화(normalization) 시의 정렬(alignment) 추적을 정,기능,プリトークン化(예: 공백으로 분할), 그리고 절단(truncation), 패딩(padding), 특수 토큰(special tokens) 추가와 같은 후처리 작업을 handles します。

Who it’s for

AI 모델을 위한 텍스트 토큰화를 위한 빠르고 다재능적이며 확장 가능한 방법이 필요한 연구자 및 프로덕션 엔지니어들을 위해 설계되었습니다.

Highlights

  • 서버 CPU에서 1GB의 텍스트를 20초 미만으로 토큰화할 수 있는 자체 고속 Rust 구현.
  • BPE, WordPiece, 및 Unigram을 포함한 여러 토큰화 모델을 지원.
  • 패딩, 절단, 및 정규화를 위한 정렬 추적을 포함한 전체 전처리 프로세스.
  • Python, Node.js, 및 Ruby 바인딩을 통한 다언어 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트