tensorflow/text

Making text a first-class citizen in TensorFlow.

何を解決するか

TensorFlow Text は、TensorFlow グラフに直接統合されるテキスト処理ツールのセットを提供します。これにより、トレーニングと推論の両方で前処理ステップ(例:トークン化や正規化)が同一になることを保証し、別々の前処理スクリプトを管理する必要や、両段階間での不整合のリスクを排除します。

仕組み

このライブラリは、テキスト操作を TensorFlow op として実装しています。UTF-8 文字列を扱い、以下のツールを提供します:

  • 正規化:ケースフォールディングと Unicode 正規化(例:NFKC)を適用して、一貫した文字表現を確保します。
  • トークン化WhitespaceTokenizer(ICU 空白文字で分割)や UnicodeScriptTokenizer(Unicode スクリプト境界に基づいて分割)などのさまざまな方法で文字列をトークンに分割します。
  • オフセット追跡TokenizerWithOffsets を使用して、トークンの正確なバイト位置を元の文字列に対して追跡します。
  • 特徴抽出Wordshape を使って、正規表現による大文字・小文字、数値、句読点などのパターンを識別します。
  • シーケンス生成:スライディングウィンドウアプローチを使用して N-gram を生成します。

対象ユーザー

TensorFlow でテキストベースのモデルを開発する開発者や機械学習エンジニアで、堅牢でグラフ統合型の前処理パイプラインが必要な方。

主な特徴

  • グラフ統合:前処理は TensorFlow グラフの一部であり、トレーニングと推論の間に一貫性を保証します。
  • Unicode サポート:UTF-8 および Unicode 正規化の包括的なサポート。
  • Ragged Tensors:Ragged Tensors のネイティブサポートにより、手動でのパディングなしで可変長シーケンスを扱えます。
  • Keras 統合:Ragged データを使用する Keras モデルとの簡単な統合を可能にする ToDense レイヤーを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト