stepfun-ai/SteptronOss

A lightweight, AI-native training framework for large language models. Designed for fast iteration, reproducible experiments, and modular configuration across SFT, RLVR, and evaluation workflows.

What it solves

StepTronOSS 是一个轻量级训练框架,旨在简化大规模语言模型的训练过程。它解决了管理实验、管理实验、确保可重复性以及加速监督式微调 (SFT)、可验证奖励强化学习 (RLVR) 和评估工作流的迭代周期问题。

How it works

该框架采用模块化、配置驱动的架构,实验是由无状态配置定义的。它利用一个名为 cfshow 的专用工具进行动态配置检查与验证,并使用 mp_run 来编排多任务实验。对于分布式训练,它使用 Redis server 进行 rendezvous,并提供工具来生成多节点启动脚本。虽然它仅需 PyTorch 作为依赖项即可运行,但它允许进行算子级别的替换(例如 FlashAttention 和 grouped GEMM)以最大化 GPU 性能。

Who it’s for

它适用于从事大规模语言模型训练的研究人员和开发者,这些人需要一个快速、可重复且具备扩展性的系统,以便在不同训练阶段进行快速的研究迭代。

Highlights

  • Config-driven workflow: 使用具有动态验证 (sanity_check) lause 的模块化配置来确保实验一致性。
  • Cores dependency: 极简的依赖项,主要在 PyTorch 上运行。
  • Multi-task orchestration: 使用灵活的启动工具进行单任务和多任务实验。
  • Performance optimizations: 支持通过 FlashAttention 和 grouped_gemm 进行算子级别的加速。
  • AI-native development: 包含为 AI agents 提供通过 AGENTS.md 进行代码变更贡献的指南。

相关

  • 项目
  • 项目
  • 项目
  • 项目