Hugging Face Transformers 與 Ray Tune 整合

Hugging Face Transformers 3.1 與 Ray Tune 整合,提供一種簡化的簡先進的 NLP 模型超參數調優。此整合使使用者能夠存取最先進的調優演算法,同時不犧牲 Transformers 框架的可自訂性。

進階調優帶來的效能提升

進階超參數優化技術在準確度與資源效率方面顯著優於簡單的網格搜索。在使用 BERT 模型於 RTE 資料集的實驗中,Population-based Training (PBT) 在測試準確度上達到最高,總 GPU 時間最低,優於其他方法:

Algorithm Best Val Acc. Best Test Acc. Total GPU min Total $ cost
Grid Search 74% 65.4% 45 min $2.30
Bayesian Optimization + Early Stop 77% 66.9% 104 min $5.30
Population-based Training 78% 70.5% 48 min $2.45

整合細節與實作

此整合可透過 Transformers 庫中的 Trainer 類別存取。在 hyperparameter_search 方法中將 backend 參數設為 `

Sources