thinking-machines-lab/tinker-cookbook

Post-training with Tinker

解決的問題

透過消除管理分散式訓練基礎設施的複雜性,簡化大型語言模型(LLMs)的客製化與微調流程。提供高階SDK與一系列實用的後訓練技術配方庫。

運作方式

本專案由兩個主要元件組成:tinker,一個訓練SDK,允許使用者將API請求傳送至管理式服務以進行分散式訓練(處理前向/反向傳播與優化器步驟),以及tinker-cookbook,在該API之上提供高階抽象與具體實作範例(配方)。

適用對象

專為希望使用SFT、RL與DPO等技術微調LLM,但又不想管理自己GPU叢集的研究人員與開發者設計。

主要亮點

  • 多樣化的訓練配方:包含可立即使用的範例,涵蓋聊天SFT、數學與程式碼RL、偏好學習(DPO/RLHF)、知識蒸餾、工具使用(RAG)以及多智能體自對弈。
  • 多模態支援:支援音訊與影像輸入的微調,特別針對Inkling模型家族。
  • 整合評估:具備支援12+個標準基準(如GSM8K、MMLU-Pro)的基準測試框架,用於評估訓練後的模型。
  • Claude Code整合:為Claude Code代理提供專用技能,協助使用者規劃、除錯與實作訓練實驗。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案