tensorflow/text
Making text a first-class citizen in TensorFlow.
解決的問題
TensorFlow Text 提供一組可直接整合至 TensorFlow 圖中的文字處理工具。這確保了在訓練與推論過程中,預處理步驟(例如分詞與標準化)完全一致,無需管理獨立的預處理腳本,也避免了兩階段之間出現不一致的風險。
工作原理
該套件將文字操作實作為 TensorFlow 操作。支援 UTF-8 字串,並提供以下工具:
- 標準化:應用大小寫折疊與 Unicode 標準化(例如 NFKC),以確保字元表示的一致性。
- 分詞:使用多種方法將字串拆分成詞元,例如
WhitespaceTokenizer(根據 ICU 空白字元拆分)與UnicodeScriptTokenizer(根據 Unicode 標準腳本邊界拆分)。 - 偏移追蹤:使用
TokenizerWithOffsets追蹤詞元相對於原始字串的精確位元組位置。 - 特徵萃取:使用
Wordshape透過正規表示式識別大寫、數值或標點等模式。 - 序列生成:使用滑動視窗方式產生 N-gram。
適用對象
在 TensorFlow 中建構文字模型的開發者與機器學習工程師,需要穩健且與圖整合的預處理流程。
主要特色
- 圖整合:預處理是 TensorFlow 圖的一部分,確保訓練與推論之間的一致性。
- Unicode 支援:全面支援 UTF-8 與 Unicode 標準化。
- Ragged Tensors:原生支援 Ragged Tensors,無需手動填補即可處理可變長度序列。
- Keras 整合:內建
ToDense層,可輕鬆將 Ragged 資料整合至 Keras 模型中。
相關
- 專案
- 專案
- 專案
- 專案
- 專案