aaron-for-value/VeriRun

Evidence-first infrastructure for reproducible, isolated executable evaluation and online rewards.

解決的問題

VeriRun 提供了一個用於評估可執行程式碼和 AI 代理的分散式執行環境。它解決了大規模執行不可信模型生成程式碼的挑戰,確保結果可重現、可恢復且安全。它明確區分了基礎設施故障(如逾時或記憶體不足)和實際模型故障(如錯誤程式碼),防止產生誤導性的基準分數。

運作方式

VeriRun 實作了一種證據優先的基礎設施,將執行視為一系列版本化、不可變的清單。它使用控制平面來管理意圖和持久狀態,並使用執行平面來處理可重試的嘗試。為了確保安全,它採用了隔離的執行層,包括摘要固定的 Docker 容器和帶有 gVisor 的 Kubernetes 作業,以提供安全邊界。它與 EvalPlus 和 LiveCodeBench 等現有基準整合,而不是取代它們,充當其下的編排和隔離層。

適用對象

它專為建置 LLM 或 AI 代理的研究人員和開發人員設計,他們需要一種可信賴、可重現的方式來執行可執行評估,並為後訓練迴圈計算線上獎勵。

亮點

  • 不可變來源:每個結果都連結到所使用的特定基準、提示、模型版本和執行階段策略。
  • 結構化失敗語意:將錯誤明確分類為編譯錯誤、測試失敗、逾時、記憶體不足和基礎設施故障。
  • 持久控制平面:使用 PostgreSQL 和相容 S3 的儲存,確保冪等結果和故障恢復。
  • 隔離執行:提供使用 Kubernetes 和 gVisor 的安全執行環境,安全執行不可信程式碼。
  • 確定性重放:允許在不重新呼叫模型的情況下重新驗證凍結的候選,確保一致性。

相關

  • 專案
  • 專案
  • 專案
  • 專案