google/tunix
A Lightweight LLM Post-Training Library
解决的问题
Tunix 是一个基于 JAX 的库,旨在简化并加速大语言模型(LLMs)的后训练过程。它提供了一个可扩展的框架,通过多种对齐和优化技术来微调模型,特别针对 TPU 上的高性能进行了优化。
工作原理
Tunix 作为 JAX 生态系统中的中间层,集成了 Flax、Optax 和 Orbax 等基础工具。它将这些工具与高性能模型实现(如 MaxText)以及推理引擎(如 vLLM 和 SGLang-JAX)连接,以高效处理模型推演和执行。
适用人群
适用于需要使用 JAX 和 TPU 基础设施进行 LLM 可扩展后训练的研究人员和开发者,包括从事监督微调和强化学习的人员。
主要亮点
- 多样化的训练算法:支持监督微调(SFT)、直接偏好优化(DPO)以及多种强化学习(RL)方法,包括 PPO、GRPO 和 GSPO-Token。
- 智能体强化学习:支持多轮工具使用、异步推演以实现高吞吐量轨迹收集,以及轨迹批处理。
- TPU 优化:与 vLLM、SGLang-JAX 和 MaxText 原生集成,实现 TPU 硬件上的顶尖性能。
- 可扩展性:通过 Pathways 实现无缝多主机分布式训练,可扩展至数千个设备。
- 模型支持:兼容 Gemma、Llama 和 Qwen 等主流模型家族。
相关
- 项目
- 项目
- 项目
- 项目
- 项目