thinking-machines-lab/tinker-cookbook
Post-training with Tinker
해결하는 문제
대규모 언어 모델(LLM)의 맞춤화 및 파인튜닝 과정을 단순화하여 분산 트레이닝 인프라를 관리하는 복잡성을 제거합니다. 다양한 포스트 트레이닝 기법을 위한 고수준 SDK와 실용적인 레시피 라이브러리를 제공합니다.
작동 방식
이 프로젝트는 두 가지 주요 구성 요소로 구성됩니다: tinker는 분산 트레이닝을 위한 관리형 서비스에 API 요청을 보내는 트레이닝 SDK로, 순전파/역전파 및 옵티마이저 스텝과 같은 작업을 처리합니다. tinker-cookbook은 이 API 위에 구축된 고수준 추상화와 구체적인 구현 예시(레시피)를 제공합니다.
대상 사용자
자체 GPU 클러스터를 관리하지 않고도 SFT, RL, DPO와 같은 기법을 사용해 LLM을 파인튜닝하고 싶은 연구자 및 개발자에게 적합합니다.
주요 특징
- 다양한 트레이닝 레시피: 챗 SFT, 수학 및 코드 RL, 선호도 학습(DPO/RLHF), 지식 증류, 도구 사용(RAG), 멀티에이전트 자가대전 등 바로 사용 가능한 예제 포함.
- 다중 모달 지원: 인클링 모델 패밀리를 위한 오디오 및 이미지 입력에 대한 파인튜닝을 지원합니다.
- 통합 평가: GSM8K, MMLU-Pro 등 12개 이상의 표준 벤치마크를 지원하는 벤치마크 프레임워크를 제공하여 훈련된 모델을 평가할 수 있습니다.
- Claude Code 통합: Claude Code 에이전트를 위한 특수 기능을 제공하여 사용자가 트레이닝 실험을 계획하고 디버깅하며 구현하는 데 도움을 줍니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트