使用 Together AI 微調 Hugging Face Hub 的大型語言模型

Together AI 與 Hugging Face 推出了整合,使得能夠使用 Together AI 的受管基礎設施微調託管於 Hugging Face Hub 上的任何相容大型語言模型(LLM)。這消除了開發者在自訂開源模型時必須管理複雜的 DevOps 工作或昂貴的訓練硬體的需求。

與 Hugging Face Hub 的雙向整合

此整合允許模型在 Hugging Face Hub 與 Together AI 的訓練環境之間無縫流動。Together AI 可以從 Hub 拉取任何相容的公開模型,也能使用 API 令牌從私人倉庫取得模型。微調完成後,若指定了目標倉庫名稱,產生的模型可自動推回 Hugging Face Hub。

技術實作:基礎模型與自訂模型

為了微調模型,Together AI 平台使用兩個參數的系統來配置訓練環境:

  • Base Model (model): 這作為訓練範本。它是來自 Together AI 官方目錄的模型,負責定義基礎設施配置、記憶體分配、GPU 資源最佳化以及推論設定。
  • Custom Model (from_hf_model): 這是使用者欲微調的特定 Hugging Face 模型。

為了取得最佳效果,自訂模型必須在架構、近似規模與序列長度上與基礎模型範本相似。例如,使用 Llama 架構的模型(如 HuggingFaceTB/SmolLM2-1.7B-Instruct)將以 togethercomputer/llama-2-7b-chat 作為其基礎模型範本。

相容性與範圍

一般而言,所有參數少於 1000 億的 CausalLM 模型皆預期相容此功能。

對開發者的影響與使用案例

此整合降低了從模型探索到投入生產的阻礙。開發者現在可以在不花費數天搭建訓練基礎設施的情況下,試驗社群驅動的創新與專門模型。

真實世界的應用

早期採用者與測試用戶已以多種方式實作此功能:

  • Domain Adaptation(領域適應):透過以已具備某些領域知識的模型為起點,將通用模型專門化於金融、醫療或法律等產業。
  • Iterative Improvement(迭代改進):以社群模型作為起點進行微調,然後再利用該結果進行進一步的精煉。
  • Community Model Specialization(社群模型專精):針對已針對特定任務(如推理、程式編寫或多語言能力)優化的模型,進一步客製化以符合專有使用情境。
  • Architecture Exploration(架構探索):快速測試隨著在 Hub 上發布的新模型變體與架構。

案例研究

  • Slingshot AI:將此功能整合至其開發流程,使其能在自有基礎設施上執行部分訓練、上傳至 Hub,然後在 Together AI 平台上持續微調。
  • Parsed:展示了透過精心策劃的資料集,小型且調校良好的開源模型可超越較大型的封閉模型。

效率提升

團隊報告稱「價值實現速度」顯著提升,能在數天而非數週內將專門化模型投入生產。此外,因為從已具備相關能力的模型開始,只需較少的訓練輪次與較小的資料集即可達到目標效能,故此流程更具成本效益。

Sources