T5Gemma: 透過僅解碼器適應的編碼器-解碼器 LLM
Google DeepMind 已推出 T5Gemma,一個新的編碼器-解碼器大型語言模型(LLM)系列,透過將預訓練的僅解碼器模型轉換為編碼器-解碼器架構來建立。此方法使模型能夠發揮編碼器-解碼器設計的優勢——例如更高的推理效率和更豐富的輸入表示——同時利用已在預訓練僅解碼器模型中捕獲的知識。
模型適應:將僅解碼器轉換為編碼器-解碼器
T5Gemma 透過一種稱為模型適應的技術來開發。與其從頭訓練編碼器-解碼器模型,不如使用預訓練僅解碼器模型的權重來初始化新模型的參數。然後,這些參數會透過使用 UL2 或 PrefixLM 為基礎的目標進行進一步的預訓練來適應。
此適應方法使得靈活的架構配置成為可能,包括「不平衡」模型。例如,9B 編碼器可以與 2B 解碼器配對(T5Gemma 9B-2B)。這種靈活性使開發者能夠為如摘要生成等任務優化品質-效率的權衡,因為理解輸入(編碼器)比生成輸出(解碼器)的複雜度更為關鍵。
品質與推理效率
T5Gemma 模型在品質-推理效率的帕累托前沿上表現優於其對應的僅解碼器 Gemma 模型。這意味著在給定的推理計算水平下,它們能提供更好的性能。
關鍵性能觀察包括:
- 延遲與準確度: 在 GSM8K(數學推理)基準測試中,T5Gemma 9B-9B 在保持類似延遲的情況下達到比 Gemma 2 9B 更高的準確度。
- 效率提升: T5Gemma 9B-2B 模型相較於 2B-2B 模型提供顯著的準確度提升,同時其延遲幾乎與更小的 Gemma 2 2B 模型相同。
- 表示品質: T5Gemma 模型在多個基準測試(包括衡量學習表示品質的 SuperGLUE)上的品質-推理效率前沿幾乎佔據主導地位。
推理與指令調整能力
T5Gemma 在其預訓練和指令調整狀態下,在推理和一般能力方面都顯示出顯著的提升。
預訓練效能
透過適應進行的預訓練在複雜推理任務中帶來提升。與原始的 Gemma 2 9B 模型相比,T5Gemma 9B-9B 的得分:
- 在 GSM8K(數學推理)上高出超過 9 分。
- 在 DROP(閱讀理解)上高出 4 分。
指令調整 (IT) 效能
T5Gemma 與僅解碼器模型之間的效能差距在指令調整後進一步擴大。例如,T5Gemma 2B-2B IT 顯示:
- MMLU 分數相比 Gemma 2 2B 提高近 12 分。
- GSM8K 分數從 58.0% 提升至 70.7%。
可用的 T5Gemma 檢查點
Google DeepMind 已在 Hugging Face、Kaggle 和 Vertex AI 向社區發布了一套 T5Gemma 檢查點。發布的模型包括:
- 多種規模: T5 規模的模型(Small、Base、Large 和 XL)、基於 Gemma 2 的模型(2B 和 9B),以及位於 T5 Large 與 T5 XL 之間的模型。
- 多種變體: 預訓練和指令調整版本均可提供。
- 靈活配置: 提供了一個不平衡的 9B-2B 檢查點,以探索編碼器-解碼器大小的權衡。
- 訓練目標: 提供使用 PrefixLM 或 UL2 目標訓練的模型,以支援最先進的生成性能或表示品質。