huggingface/tokenizers

💥 Fast State-of-the-Art Tokenizers optimized for Research and Production

What it solves

Tokenization 是機器學習模型關鍵的預處理步驟。此函式庫提供了最廣泛使用的分詞演算法的高效能實作,讓開發者能夠將原始文本轉換為模型可以理解的分詞(tokens)。

How it works

本專案以 Rust 實作,以追求極致速度,並提供 Python、Node.js 與 Ruby 的綁定(bindings)。它允許使用者透過 BPE、WordPiece 或 Unigram 等演算法來訓練新的詞彙表(vocabularies)。它處理整個預處理流程,包括帶有對齊追蹤的正規化(normalization)、預分詞(例如透過空格拆分)以及後處理任務,如截斷(truncation)、填充(padding)與加入特殊分詞(special tokens)。

Who it’s for

它專為需要快速、多功能且具擴展性的方式來為 AI 模型進行文本分詞的研究人員與生產環境工程師而設計。

Highlights

  • 自有的高速度 Rust 實作,在伺服器 CPU 上可以在 20 秒內分詞一個 GB 的文本。
  • 支援多種分詞模型,包括 BPE、WordPiece 與 Unigram。
  • 完整的預處理套件,包括填充、截斷以及用於正規化的對齊追蹤。
  • 透過 Python、Node.js 與 Ruby 的綁定提供多語言支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案