huggingface/tokenizers

💥 Fast State-of-the-Art Tokenizers optimized for Research and Production

What it solves

Tokenization は、機械学習モデルにとって極めて重要な前処理ステップです。このライブラリは、最も広く使用されている分詞アルゴリズムの高精度な実装を提供し、開発者が生のテキストをモデルが理解できるトークンに変換できるようにします。

How it works

このプロジェクトは、最大限の速度を実現するために Rust で実装されており、Python、Node.js、および Ruby のバインディングを提供しています。BPE、WordPiece、または Unigram アルゴリズムを使用して、新しい語彙(vocabularies)を学習させることが可能です。アライメント追跡を伴う正規化(normalization)、プリトークン化(例:空白による分割)、および切り捨て(truncation)、パディング(padding)、特殊トークンの追加といった後処理タスクを handles します。

Who it’s for

AI モデル向けにテキストを分詞するための、高速、多機能、かつスケーラブルな方法を必要とする研究者やプロダクションエンジニア向けに設計されています。

Highlights

  • サーバー CPU 上で 1GB のテキストを 20 秒未満で分詞できる、独自の高速 Rust 実装。
  • BPE、WordPiece、および Unigram を含む複数の分詞モデルをサポート。
  • パディング、切り捨て、および正規化のためのアライメント追跡を含む、完全な前処理スイート。
  • Python、Python、Node.js、および Ruby のバインディングによるマルチ言語サポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト