inclusionAI/AReno

An easy-to-use, fast toolkit to scale up RL post-training on a single node.

解決的問題

AReno 設計用於透過提供一個自給自足的單節點工具包,使 LLM 強化學習(RL)與後訓練更易於使用。它消除了對複雜叢集設定、獨立推論伺服器或碎片化訓練框架的需求,讓開發者能於單一機器上,從基礎模型檢查點直接完成訓練並部署模型。

如何運作

AReno 採用全棧設計,針對單節點效能進行最佳化。它提供 Trainer 類別與 CLI,處理整個 RL 循環:產生在策略完成(rollout)、透過使用者定義的獎勵函數進行評分,以及更新模型權重(訓練)。原生支援 CUDA(Linux)與 MLX(Apple Silicon)後端。

適用對象

專為希望使用 RL、SFT 或 DPO 風格訓練,在無需管理大型基礎設施的情況下,快速於本地完成 LLM 後訓練的研究人員與開發者所設計。

主要亮點

  • 即插即用:透過簡單的 --algo 標誌或 Python API 即可存取各種後訓練演算法。
  • 支援智能體 RL:支援透過與本地 OpenAI 相容代理互動,並從軌跡中訓練智能體。
  • 多模態支援:使用 OpenAI 風格訊息格式,相容影像、音訊與影片內容。
  • 硬體彈性:原生支援透過 CUDA 的 NVIDIA GPU 與透過 MLX 的 Apple Silicon。
  • 整合式服務:內建 OpenAI 相容伺服器,支援連續批次處理,可立即部署訓練完成的模型。
  • 運維智能體:內建 AI 助手(areno agent),協助使用者設定與執行訓練命令。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案