tensorflow/text
Making text a first-class citizen in TensorFlow.
何を解決するか
TensorFlow Text は、TensorFlow グラフに直接統合されるテキスト処理ツールのセットを提供します。これにより、トレーニングと推論の両方で前処理ステップ(例:トークン化や正規化)が同一になることを保証し、別々の前処理スクリプトを管理する必要や、両段階間での不整合のリスクを排除します。
仕組み
このライブラリは、テキスト操作を TensorFlow op として実装しています。UTF-8 文字列を扱い、以下のツールを提供します:
- 正規化:ケースフォールディングと Unicode 正規化(例:NFKC)を適用して、一貫した文字表現を確保します。
- トークン化:
WhitespaceTokenizer(ICU 空白文字で分割)やUnicodeScriptTokenizer(Unicode スクリプト境界に基づいて分割)などのさまざまな方法で文字列をトークンに分割します。 - オフセット追跡:
TokenizerWithOffsetsを使用して、トークンの正確なバイト位置を元の文字列に対して追跡します。 - 特徴抽出:
Wordshapeを使って、正規表現による大文字・小文字、数値、句読点などのパターンを識別します。 - シーケンス生成:スライディングウィンドウアプローチを使用して N-gram を生成します。
対象ユーザー
TensorFlow でテキストベースのモデルを開発する開発者や機械学習エンジニアで、堅牢でグラフ統合型の前処理パイプラインが必要な方。
主な特徴
- グラフ統合:前処理は TensorFlow グラフの一部であり、トレーニングと推論の間に一貫性を保証します。
- Unicode サポート:UTF-8 および Unicode 正規化の包括的なサポート。
- Ragged Tensors:Ragged Tensors のネイティブサポートにより、手動でのパディングなしで可変長シーケンスを扱えます。
- Keras 統合:Ragged データを使用する Keras モデルとの簡単な統合を可能にする
ToDenseレイヤーを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト