stepfun-ai/SteptronOss

A lightweight, AI-native training framework for large language models. Designed for fast iteration, reproducible experiments, and modular configuration across SFT, RLVR, and evaluation workflows.

What it solves

StepTronOSS 是一個輕量級訓練框架,旨在簡化大規模語言模型的訓練過程。它解決了管理實驗、確保可重複性以及加速監督式微調 (SFT)、可驗證獎勵強化學習 (RLVR) 和評估工作流的迭代週期問題。

How it works

該框架採用模組化、配置驅動的架構,實驗是由無狀態配置定義的。它利用一個名為 cfshow 的專用工具進行動態配置檢查與驗證,並使用 mp_run 來編排多任務實驗。對於分散式訓練,它使用 Redis server 進行 rendezvous,並提供工具來生成多節點啟動腳本。雖然它僅需 PyTorch 作為依賴項即可運行,但它允許進行算子級別的替換(例如 FlashAttention 和 grouped GEMM)以最大化 GPU 性能。

Who it’s for

它適用於從事大規模語言模型訓練的研究人員和開發人員,這些人需要一個快速、可重複且具備擴展性的系統,以便在不同訓練階段進行快速的研究迭代。

Highlights

  • Config-driven workflow: 使用具有動態驗證 (sanity_check) 的模組化配置來確保實驗一致性。
  • Cores dependency: 極簡的依賴項,主要在 PyTorch 上運行。
  • Multi-task orchestration: 為單任務和多任務實驗提供靈活的啟動工具。
  • Performance optimizations: 支援透過 FlashAttention 和 grouped_gemm 進行算子級別的加速。
  • AI-native development: 包含為 AI agents 提供透過 AGENTS.md 進行代碼變更貢獻的指南。

相關

  • 專案
  • 專案
  • 專案
  • 專案