tensorflow/text

Making text a first-class citizen in TensorFlow.

解決的問題

TensorFlow Text 提供一組可直接整合至 TensorFlow 圖中的文字處理工具。這確保了在訓練與推論過程中,預處理步驟(例如分詞與標準化)完全一致,無需管理獨立的預處理腳本,也避免了兩階段之間出現不一致的風險。

工作原理

該套件將文字操作實作為 TensorFlow 操作。支援 UTF-8 字串,並提供以下工具:

  • 標準化:應用大小寫折疊與 Unicode 標準化(例如 NFKC),以確保字元表示的一致性。
  • 分詞:使用多種方法將字串拆分成詞元,例如 WhitespaceTokenizer(根據 ICU 空白字元拆分)與 UnicodeScriptTokenizer(根據 Unicode 標準腳本邊界拆分)。
  • 偏移追蹤:使用 TokenizerWithOffsets 追蹤詞元相對於原始字串的精確位元組位置。
  • 特徵萃取:使用 Wordshape 透過正規表示式識別大寫、數值或標點等模式。
  • 序列生成:使用滑動視窗方式產生 N-gram。

適用對象

在 TensorFlow 中建構文字模型的開發者與機器學習工程師,需要穩健且與圖整合的預處理流程。

主要特色

  • 圖整合:預處理是 TensorFlow 圖的一部分,確保訓練與推論之間的一致性。
  • Unicode 支援:全面支援 UTF-8 與 Unicode 標準化。
  • Ragged Tensors:原生支援 Ragged Tensors,無需手動填補即可處理可變長度序列。
  • Keras 整合:內建 ToDense 層,可輕鬆將 Ragged 資料整合至 Keras 模型中。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案