Hugging Face 零樣本評估於 Hub
Hugging Face 透過「Evaluation on the Hub」工具,為因果語言模型啟用了零樣本評估。此更新讓研究人員與開發者能在分類任務上測量模型效能,無需標記的訓練資料或自訂 GPU 基礎設施,從而讓大型語言模型(LLM)的基準測試更為大眾化。
零樣本評估基礎設施
由 AutoTrain 提供動力的 Evaluation on the Hub 現已支援對任何託管於 Hub 上的因果語言模型進行零樣本分類。此系統消除評估大規模模型的技術與財務障礙,例如載入與編譯數十億參數模型所需的大量時間與硬體成本。
Key technical details of the infrastructure include:
- 模型容量:該工具目前支援最高 660 億參數的模型,未來計畫支援更大的模型。
- 效能:在零樣本分類任務中,使用 2,000 個句子長度的範例評估 660 億參數模型大約需要 3.5 小時。
- 機制:零樣本文字分類任務透過將可能的完成句接在提示後,並對每個 token 的對數機率求和來運作。接著將這些值正規化,與正確的完成句比較,以決定準確度。
案例研究:WinoBias 中的性別偏見
為了展示該工具的功能,Hugging Face 使用 WinoBias 資料集評估了多種 OPT 模型,該資料集衡量與職業相關的性別偏見。在此任務中,模型必須選擇正確的代名詞(刻板印象或反刻板印象)來完成提及特定職業的句子。
評估顯示出「逆向擴展」的趨勢:較小的模型較傾向選擇反刻板印象的代名詞,而較大的模型則較可能依賴性別與職業之間的刻板印象關聯。此發現與其他基準(如 BIG-Bench)以及先前研究相符,這些研究指出較大且更有能力的模型更容易產生有害文字或展現與種族、族裔及國籍相關的偏見。
對 AI 研究與逆向擴展的影響
Evaluation on the Hub 被設計為低程式碼工具,協助研究人員分析模型在不同維度(如模型大小或 FLOPS)上的行為。由於零樣本文字分類任務具彈性,任何可格式化為 Winograd schema(即範例僅在少數詞彙上不同)的資料集皆可用於基準測試。
此可及性對於研究「逆向擴展問題」尤為有用——即較大的模型在特定任務上表現不如較小的模型。Hugging Face 鼓勵社群使用這些工具來辨識此類趨勢,並參與如 Inverse Scaling Prize 等倡議,該獎項挑戰研究人員找出模型大小與效能提升不具相關性的任務。