PrimeIntellect-ai/verifiers

Our library for RL environments + evals

解決的問題

提供一個標準化的程式庫,用於建立用於訓練與評估大型語言模型(LLMs)的環境,特別針對強化學習工作流程設計。

如何運作

此程式庫作為一個框架,用於建構可與 Prime Intellect 生態系統(包括其訓練框架 prime-rl 與主機訓練平台)整合的環境。設計為可與 CLI 工具搭配使用,以進行互動與管理。

適用對象

專注於 LLM 強化學習,需要結構化方式來定義與測試模型在特定環境中表現的開發者與研究人員。

主要特色

  • 與 Environments Hub、prime-rl 和主機訓練平台整合。
  • 支援建立用於訓練與評估的環境。
  • 透過專用技能與文件,特別支援程式碼代理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案