google-research/text-to-text-transfer-transformer
Code for the paper "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer"
解決的問題
本專案提供文本到文本遷移變換器(T5)的實作,此模型設計為將所有NLP任務視為文字到文字的問題。這使得單一模型可在大型文字語料庫上進行預訓練,並針對多樣化的NLP任務進行微調,進而在各項基準測試中達成最尖端的成果。
工作原理
T5使用Transformer架構,輸入與輸出始終為字串。它透過 t5.data 套件提供統一的框架來載入、預處理與評估資料集,該套件負責任務定義、SentencePiece分詞與指標函數。該程式庫提供適配器,將這些任務與模型實作連接起來,支援使用Mesh TensorFlow進行大規模TPU訓練,以及使用Hugging Face Transformers套件進行GPU基礎的PyTorch微調。
適用對象
希望重現原始T5論文實驗、在自訂資料集上微調預訓練T5模型,或為大規模NLP任務開發新型文字到文字模型的研究人員與開發者。
主要亮點
- 統一的文字到文字框架:將所有NLP任務(翻譯、分類等)視為字串到字串的對應。
- 可擴展的資料流程:包含
t5.data用於定義任務、任務混合用於多任務訓練,並與TensorFlow Datasets (TFDS) 集成。 - 可擴展的訓練:基於Mesh TensorFlow建構,支援在TPU上進行高效能訓練,支援模型平行與資料平行。
- 預訓練檢查點:提供可存取的已發布模型檢查點與操作設定,用於重現論文結果。
相關
- 專案
- 專案
- 專案
- 專案