thinking-machines-lab/tinker-cookbook
Post-training with Tinker
解决的问题
通过消除管理分布式训练基础设施的复杂性,简化了定制和微调大型语言模型(LLMs)的过程。提供高级SDK和一系列实用的后训练技术配方库。
工作原理
该项目由两个主要组件构成:tinker,一个训练SDK,允许用户向托管服务发送API请求以进行分布式训练(处理前向/反向传播和优化器步骤),以及tinker-cookbook,它在该API基础上提供高级抽象和具体的实现示例(配方)。
适用人群
专为希望使用SFT、RL和DPO等技术微调LLM,但又不想管理自己GPU集群的研究人员和开发者设计。
主要亮点
- 多样化的训练配方:包含可直接使用的示例,涵盖聊天SFT、数学与代码RL、偏好学习(DPO/RLHF)、知识蒸馏、工具使用(RAG)以及多智能体自对弈。
- 多模态支持:支持音频和图像输入的微调,特别针对Inkling模型系列。
- 集成评估:具备支持12+个标准基准(如GSM8K、MMLU-Pro)的基准测试框架,用于评估训练后的模型。
- Claude Code集成:为Claude Code代理提供专用技能,帮助用户规划、调试和实现训练实验。
相关
- 项目
- 项目
- 项目
- 项目
- 项目