stepfun-ai/SteptronOss
A lightweight, AI-native training framework for large language models. Designed for fast iteration, reproducible experiments, and modular configuration across SFT, RLVR, and evaluation workflows.
What it solves
StepTronOSS 是一个轻量级训练框架,旨在简化大规模语言模型的训练过程。它解决了管理实验、管理实验、确保可重复性以及加速监督式微调 (SFT)、可验证奖励强化学习 (RLVR) 和评估工作流的迭代周期问题。
How it works
该框架采用模块化、配置驱动的架构,实验是由无状态配置定义的。它利用一个名为 cfshow 的专用工具进行动态配置检查与验证,并使用 mp_run 来编排多任务实验。对于分布式训练,它使用 Redis server 进行 rendezvous,并提供工具来生成多节点启动脚本。虽然它仅需 PyTorch 作为依赖项即可运行,但它允许进行算子级别的替换(例如 FlashAttention 和 grouped GEMM)以最大化 GPU 性能。
Who it’s for
它适用于从事大规模语言模型训练的研究人员和开发者,这些人需要一个快速、可重复且具备扩展性的系统,以便在不同训练阶段进行快速的研究迭代。
Highlights
- Config-driven workflow: 使用具有动态验证 (
sanity_check) lause 的模块化配置来确保实验一致性。 - Cores dependency: 极简的依赖项,主要在 PyTorch 上运行。
- Multi-task orchestration: 使用灵活的启动工具进行单任务和多任务实验。
- Performance optimizations: 支持通过 FlashAttention 和
grouped_gemm进行算子级别的加速。 - AI-native development: 包含为 AI agents 提供通过
AGENTS.md进行代码变更贡献的指南。
相关
- 项目
- 项目
- 项目
- 项目