thinking-machines-lab/tinker-cookbook
Post-training with Tinker
解決的問題
透過消除管理分散式訓練基礎設施的複雜性,簡化大型語言模型(LLMs)的客製化與微調流程。提供高階SDK與一系列實用的後訓練技術配方庫。
運作方式
本專案由兩個主要元件組成:tinker,一個訓練SDK,允許使用者將API請求傳送至管理式服務以進行分散式訓練(處理前向/反向傳播與優化器步驟),以及tinker-cookbook,在該API之上提供高階抽象與具體實作範例(配方)。
適用對象
專為希望使用SFT、RL與DPO等技術微調LLM,但又不想管理自己GPU叢集的研究人員與開發者設計。
主要亮點
- 多樣化的訓練配方:包含可立即使用的範例,涵蓋聊天SFT、數學與程式碼RL、偏好學習(DPO/RLHF)、知識蒸餾、工具使用(RAG)以及多智能體自對弈。
- 多模態支援:支援音訊與影像輸入的微調,特別針對Inkling模型家族。
- 整合評估:具備支援12+個標準基準(如GSM8K、MMLU-Pro)的基準測試框架,用於評估訓練後的模型。
- Claude Code整合:為Claude Code代理提供專用技能,協助使用者規劃、除錯與實作訓練實驗。
相關
- 專案
- 專案
- 專案
- 專案
- 專案