inclusionAI/AReno
An easy-to-use, fast toolkit to scale up RL post-training on a single node.
解決的問題
AReno 設計用於透過提供一個自給自足的單節點工具包,使 LLM 強化學習(RL)與後訓練更易於使用。它消除了對複雜叢集設定、獨立推論伺服器或碎片化訓練框架的需求,讓開發者能於單一機器上,從基礎模型檢查點直接完成訓練並部署模型。
如何運作
AReno 採用全棧設計,針對單節點效能進行最佳化。它提供 Trainer 類別與 CLI,處理整個 RL 循環:產生在策略完成(rollout)、透過使用者定義的獎勵函數進行評分,以及更新模型權重(訓練)。原生支援 CUDA(Linux)與 MLX(Apple Silicon)後端。
適用對象
專為希望使用 RL、SFT 或 DPO 風格訓練,在無需管理大型基礎設施的情況下,快速於本地完成 LLM 後訓練的研究人員與開發者所設計。
主要亮點
- 即插即用:透過簡單的
--algo標誌或 Python API 即可存取各種後訓練演算法。 - 支援智能體 RL:支援透過與本地 OpenAI 相容代理互動,並從軌跡中訓練智能體。
- 多模態支援:使用 OpenAI 風格訊息格式,相容影像、音訊與影片內容。
- 硬體彈性:原生支援透過 CUDA 的 NVIDIA GPU 與透過 MLX 的 Apple Silicon。
- 整合式服務:內建 OpenAI 相容伺服器,支援連續批次處理,可立即部署訓練完成的模型。
- 運維智能體:內建 AI 助手(
areno agent),協助使用者設定與執行訓練命令。
相關
- 專案
- 專案
- 專案
- 專案
- 專案