google-research/text-to-text-transfer-transformer

Code for the paper "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer"

해결하는 문제

이 프로젝트는 모든 NLP 작업을 텍스트에서 텍스트로의 문제로 간주하도록 설계된 Text-To-Text Transfer Transformer (T5)의 구현을 제공합니다. 이를 통해 하나의 모델이 대규모 텍스트 코퍼스에서 사전 훈련된 후 다양한 NLP 작업에 대해 미세 조정될 수 있으며, 다양한 벤치마크에서 최고 수준의 성능을 달성할 수 있습니다.

작동 방식

T5는 입력과 출력이 항상 문자열인 Transformer 아키텍처를 사용합니다. t5.data 패키지를 통해 데이터셋의 로드, 전처리, 평가를 통합된 프레임워크로 처리하며, 이는 작업 정의, SentencePiece 토큰화, 메트릭 함수를 관리합니다. 라이브러리는 이러한 작업을 모델 구현에 연결하기 위한 쉴을 제공하며, 대규모 TPU 훈련에는 Mesh TensorFlow를, GPU 기반 PyTorch 미세 조정에는 Hugging Face Transformers 라이브러리를 지원합니다.

대상 사용자

원본 T5 논문의 실험을 재현하고 싶은 연구자 및 개발자, 사용자 정의 데이터셋에서 사전 훈련된 T5 모델을 미세 조정하고 싶은 사람, 대규모 NLP 작업을 위한 새로운 텍스트에서 텍스트 모델을 개발하고 싶은 사람.

주요 특징

  • 통합된 텍스트에서 텍스트로의 프레임워크: 번역, 분류 등 모든 NLP 작업을 문자열에서 문자열로의 매핑으로 간주합니다.
  • 확장 가능한 데이터 파이프라인: t5.data를 사용하여 작업과 작업의 혼합을 정의하고, TensorFlow Datasets (TFDS)와 통합할 수 있습니다.
  • 확장 가능한 훈련: Mesh TensorFlow를 사용하여 TPU에서 고성능 훈련을 지원하며, 모델 병렬 및 데이터 병렬을 지원합니다.
  • 사전 훈련된 체크포인트: 논문 결과를 재현하기 위해 공개된 모델 체크포인트와 운영 구성에 접근할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트