tensorflow/text
Making text a first-class citizen in TensorFlow.
해결하는 문제
TensorFlow Text는 TensorFlow 그래프에 직접 통합되는 텍스트 처리 도구 세트를 제공합니다. 이로 인해 토큰화 및 정규화와 같은 전처리 단계가 트레이닝과 추론 시 동일하게 작동하게 되어, 별도의 전처리 스크립트를 관리하거나 두 단계 간의 일관성 문제를 걱정할 필요가 없습니다.
작동 방식
이 라이브러리는 텍스트 작업을 TensorFlow op로 구현합니다. UTF-8 문자열을 처리하며 다음과 같은 도구를 제공합니다:
- 정규화: 케이스 폴딩과 Unicode 정규화(NFKC 등)를 적용하여 일관된 문자 표현을 보장합니다.
- 토큰화:
WhitespaceTokenizer(ICU 공백 기준 분할) 및UnicodeScriptTokenizer(Unicode 스크립트 경계 기준 분할)와 같은 다양한 방법으로 문자열을 토큰으로 나눕니다. - 오프셋 추적:
TokenizerWithOffsets를 사용하여 토큰의 정확한 바이트 위치를 원본 문자열에 대해 추적합니다. - 특징 추출:
Wordshape를 사용해 정규 표현식을 통해 대문자, 숫자, 구두점 등의 패턴을 식별합니다. - 시퀀스 생성: 슬라이딩 윈도우 방식을 사용하여 N-gram을 생성합니다.
대상 사용자
TensorFlow에서 텍스트 기반 모델을 개발하는 개발자 및 머신러닝 엔지니어로, 견고하고 그래프 통합형 전처리 파이프라인을 필요로 하는 분들입니다.
주요 특징
- 그래프 통합: 전처리가 TensorFlow 그래프의 일부로 포함되어 트레이닝과 추론 간 일관성을 보장합니다.
- Unicode 지원: UTF-8 및 Unicode 정규화에 대한 포괄적인 지원.
- Ragged Tensors: 변형 길이 시퀀스를 수동 패딩 없이 처리할 수 있도록 Ragged Tensors의 네이티브 지원.
- Keras 통합: Ragged 데이터를 사용하는 Keras 모델과의 간편한 통합을 위한
ToDense레이어 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트