tensorflow/text

Making text a first-class citizen in TensorFlow.

해결하는 문제

TensorFlow Text는 TensorFlow 그래프에 직접 통합되는 텍스트 처리 도구 세트를 제공합니다. 이로 인해 토큰화 및 정규화와 같은 전처리 단계가 트레이닝과 추론 시 동일하게 작동하게 되어, 별도의 전처리 스크립트를 관리하거나 두 단계 간의 일관성 문제를 걱정할 필요가 없습니다.

작동 방식

이 라이브러리는 텍스트 작업을 TensorFlow op로 구현합니다. UTF-8 문자열을 처리하며 다음과 같은 도구를 제공합니다:

  • 정규화: 케이스 폴딩과 Unicode 정규화(NFKC 등)를 적용하여 일관된 문자 표현을 보장합니다.
  • 토큰화: WhitespaceTokenizer(ICU 공백 기준 분할) 및 UnicodeScriptTokenizer(Unicode 스크립트 경계 기준 분할)와 같은 다양한 방법으로 문자열을 토큰으로 나눕니다.
  • 오프셋 추적: TokenizerWithOffsets를 사용하여 토큰의 정확한 바이트 위치를 원본 문자열에 대해 추적합니다.
  • 특징 추출: Wordshape를 사용해 정규 표현식을 통해 대문자, 숫자, 구두점 등의 패턴을 식별합니다.
  • 시퀀스 생성: 슬라이딩 윈도우 방식을 사용하여 N-gram을 생성합니다.

대상 사용자

TensorFlow에서 텍스트 기반 모델을 개발하는 개발자 및 머신러닝 엔지니어로, 견고하고 그래프 통합형 전처리 파이프라인을 필요로 하는 분들입니다.

주요 특징

  • 그래프 통합: 전처리가 TensorFlow 그래프의 일부로 포함되어 트레이닝과 추론 간 일관성을 보장합니다.
  • Unicode 지원: UTF-8 및 Unicode 정규화에 대한 포괄적인 지원.
  • Ragged Tensors: 변형 길이 시퀀스를 수동 패딩 없이 처리할 수 있도록 Ragged Tensors의 네이티브 지원.
  • Keras 통합: Ragged 데이터를 사용하는 Keras 모델과의 간편한 통합을 위한 ToDense 레이어 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트